사이오닉에이아이가 검색 임베딩 모델 ‘comsat-embed’의 한국어·일본어 버전을 개발해 공개했다. 이 모델은 질문과 문서를 수치화해 연관성 높은 자료를 선별하는 검색 임베딩 모델로, 다국어 검색 성능을 평가하는 MTEB 검색 영역에서 비교 대상 중 가장 높은 평균 점수를 기록했다.
comsat-embed는 실제 검색 환경에서 나타나는 복잡한 형태를 그대로 반영해 학습됐다. 짧은 키워드부터 장문 질의까지 다양한 질문 형태는 물론, 하나의 질문이 여러 문서와 연결되거나 여러 질문이 하나의 문서를 가리키는 1대다·다대1 관계까지 학습 데이터에 포함시켰다. 여기에 하드 네거티브 마이닝과 지식 증류 방식을 적용해 특정 데이터셋에 편중되지 않고 전 영역에서 고른 성능 개선을 추구했다.
한국어·일본어 모두 최고 점수
한국어 8B 모델 ‘comsat-embed-ko-8b-preview’는 MTEB 한국어 검색 영역 9개 데이터셋 평균 NDCG@10에서 79.30을 기록했다. 이는 알리바바의 ‘Qwen3-Embedding-8B’(78.25), 마이크로소프트의 27B 모델 ‘Harrier-OSS-v1-27B’(76.69)보다 높은 수치다.
일본어 8B 모델 ‘comsat-embed-ja-8b-preview’는 MTEB 일본어 검색 영역 11개 데이터셋 평균 NDCG@10에서 81.33을 기록했다. 파라미터 3억개 규모의 소형 모델 ‘comsat-embed-ja-0.3b-preview’도 NDCG@10 77.85를 기록해 4B 이하 비교 모델 중 선두에 올랐다.

범용 검색 프로젝트 ‘EUREKA’의 첫 결과물
comsat-embed는 언어·도메인·질문 형태가 달라져도 안정적인 검색 성능을 구현하기 위한 프로젝트 ‘EUREKA’의 성과다. 현재는 허깅페이스에 프리뷰 버전으로 공개돼 있으며, 실제 기업 데이터와 복합적인 질문 상황에서도 동일한 성능을 재현할 수 있는지가 다음 검증 과제로 남아 있다.