Linkup, 149M 파라미터 오픈소스 스파스 검색 모델 SPARSEUP Apache 2.0 라이선스로 공개
Linkup Research는 Apache 2.0 라이선스로 Hugging Face에 SPARSEUP을 공개했으며, 149백만 파라미터 ModernBERT 기반으로 어휘 토큰마다 차원을 갖는 스파스 벡터를 생성하고 LightOn의 공개 데이터셋에서 대비 학습을 수행해 50개 중 7개의 어려운 네거티브를 사용합니다.

SPARSEUP 소개: 오픈소스 희소 검색 모델
Linkup Research는 SPARSEUP을 Apache 2.0 라이선스로 공개했으며, 모델 가중치는 Hugging Face 플랫폼에 업로드되었습니다. 이번 공개는 희소 검색 기법의 투명하고 커뮤니티 주도적인 개발을 향한 중요한 발걸음으로, 소스 코드와 파라미터를 제한 없는 라이선스 조건 하에 검토, 수정 및 재배포할 수 있게 되었습니다.
SPARSEUP의 아키텍처는 1억 4,900만 개 파라미터를 갖는 ModernBERT 백본을 기반으로 합니다. 기존의 밀집 검색 모델이 문서당 하나의 밀집 벡터를 생성하는 것과 달리, SPARSEUP은 각 차원이 모델 어휘의 토큰과 직접 연결된 희소 벡터를 생성합니다. 따라서 비제로 항목이 나타날 때마다 특정 토큰의 존재 또는 관련성을 명확히 나타내어, 표현이 언어학적 해석 가능성을 유지합니다.
초기화 전략은 두 단계로 진행됩니다. 첫 번째 단계에서는 대규모 코퍼스에 대한 비지도 사전학습을 이미 포함하고 있는 LateOn‑unsupervised 체크포인트의 가중치를 계승합니다. 두 번째 단계에서는 오픈소스 LightOn 데이터 믹스를 이용해 대조 학습을 수행합니다. 이 과정에서 각 쿼리는 하나의 양성 문서와 50개의 후보 중에서 선정된 7개의 어려운 음성 문서와 짝을 이루며, 이는 모델의 구분 능력을 강화하도록 설계되었습니다.
희소성 제어 메커니즘
출력 벡터의 희소성을 조절하는 세 가지 명시적 메커니즘이 존재합니다. 첫 번째 메커니즘은 소프트맥스 적용 전에 로짓에 15의 상수를 더해 많은 토큰 점수를 활성화 임계값 이하로 밀어냅니다. 두 번째 메커니즘은 토큰 위치당 활성 차원 수를 12개로 제한하여 단일 위치가 과도한 비제로 항목을 생성하지 않도록 합니다. 세 번째 메커니즘은 대소문자와 공백 차이를 통합해, 대소문자나 공백만 다른 토큰을 하나의 차원으로 병합합니다. 이 세 가지 제어가 결합되어 해석 가능하면서도 계산 효율적인 표현을 형성합니다.
대소문자·공백 통합 과정에서 어휘 크기가 감소합니다. 약 5만 개 토큰으로 시작한 어휘는 병합을 거쳐 최종적으로 약 3만 4천 개 차원으로 축소됩니다. 이 축소는 희소 벡터의 저장 및 색인 비용을 직접 낮추면서도 검색에 필요한 핵심 어휘 구분을 유지합니다.
표준 벤치마크 성능
Linkup은 BEIR‑13 컬렉션(※ MS MARCO 서브셋 제외)에서 nDCG@10 점수가 56.4임을 보고했습니다. 저자에 따르면, 이는 1억 5천만 파라미터 미만 모델 중 공개된 결과 중 가장 높은 수치라고 합니다. 이 지표는 표준 BEIR 테스트 쿼리에 적용된 평가 프로토콜의 직접적인 산출물입니다.
SPARSEUP을 동일한 데이터 기반과 백본 크기를 공유하는 밀집 및 후기‑상호작용 베이스라인과 비교했을 때, 보고된 점수는 SPARSEUP이 선도적인 밀집 접근법을 능가하지 못함을 보여줍니다. 구체적으로 DenseOn 구성은 nDCG@10이 57.9, LateOn 구성은 동일 벤치마크에서 58.9를 기록했습니다. 이 수치는 Linkup이 인용한 것으로, 희소성 중심 설계에도 불구하고 성능 격차가 존재함을 나타냅니다.
이 격차는 동일한 학습 조건 하에서 밀집 표현이 미묘한 의미 유사성을 포착하는 데 여전히 우위가 있을 수 있음을 시사합니다. 그러나 희소 모델은 색인 크기 감소와 잠재적인 빠른 검색과 같은 뚜렷한 트레이드오프를 제공하므로, 자원 제약이 설계 선택을 좌우하는 상황에서 가치가 있을 수 있습니다.
Seismic 색인으로 본 속도와 재현율
Linkup은 희소 벡터에 최적화된 Seismic이라는 색인 구조를 소개했습니다. 이 색인을 활용해 SPARSEUP은 MS MARCO 데이터셋에 대해 정확 검색 대비 97 % 이상의 재현율을 달성하면서, 각 쿼리를 약 380 마이크로초에 처리한다고 주장합니다. 이러한 수치는 MS MARCO 테스트 컬렉션에서 얻은 실험적 측정값으로 제시되었습니다.
저자는 보고된 지연 시간과 재현율 수치는 최종 사용자가 자체 데이터에서 재현해야 한다고 명시적으로 강조합니다. 이는 성능이 하드웨어 구성, 쿼리 분포, 데이터셋 특성 등에 따라 달라질 수 있음을 인정하고, 검증 없이 일반화될 수 없음을 알리는 면책 조항입니다.
- Apache 2.0 라이선스로 자유로운 재배포 보장
- 149 M 파라미터 ModernBERT 백본
- 50 후보 중 7개의 어려운 음성을 사용한 대조 학습
- 희소성 제어 3가지: 로짓 오프셋, 위치별 제한, 대소문자·공백 통합
위 목록은 SPARSEUP이 다른 검색 모델과 차별화되는 핵심 기술 선택을 요약합니다. 각 항목은 법적 접근성, 모델 용량, 학습 역학 또는 최종 표현의 희소성 특성에 직접적인 영향을 미치는 설계 결정을 반영합니다.
방법론적 관점에서 보면, 고정된 수의 어려운 음성을 사용하는 것은 대조 학습 중 난이도를 제어하는 장점을 제공합니다. 그러나 음성이 50개의 제한된 풀에서 선택되기 때문에 도전적인 사례의 다양성이 제한될 수 있으며, 이는 모델이 보지 못한 쿼리‑문서 쌍에 일반화하는 능력을 저해할 가능성이 있습니다.
희소성 메커니즘은 차원 축소에 효과적이지만, 동시에 정보가 풍부한 신호를 차단할 수 있는 강경한 임계값을 적용합니다. 예를 들어 로짓 오프셋 15는 많은 토큰 점수를 활성화 이하로 밀어 효율성을 높이지만, 특정 쿼리에서 중요한 미세 어휘 단서를 억제할 위험이 있습니다.
대소문자·공백 통합을 통해 약 5만 차원에서 3만 4천 차원으로 감소하는 과정은 색인을 단순화하지만, 대소문자 구분이 의미 차이를 만드는 언어에서는 서로 다른 의미를 갖는 토큰을 하나로 합칠 수 있습니다. 이는 압축과 언어적 충실성 사이의 긴장을 보여주는 전형적인 희소 검색 설계의 트레이드오프입니다.
현재 구성은 단일 언어 토큰 집합을 기반으로 하므로, 더 큰 어휘나 다국어 환경으로 확장할 경우 희소성 제어를 재조정해야 차원 폭증을 방지할 수 있을지에 대한 질문이 남습니다.
또 다른 미래 연구 영역은 희소 표현과 하이브리드 검색 파이프라인 간의 상호작용입니다. SPARSEUP 벡터와 밀집 임베딩을 결합하면 상보적인 관련성 측면을 포착할 가능성이 있지만, 구체적인 통합 전략은 실험적 검증이 필요합니다.
요약하면, SPARSEUP은 투명하고 오픈소스인 희소 검색 모델로, Seismic 색인 하에서 경쟁력 있는 재현율과 낮은 지연 시간을 달성하면서도 150 M 파라미터 이하 영역에서 평균적인 벤치마크 점수를 기록합니다. 모델 설계 선택은 해석 가능성, 효율성, 검색 효과성 간의 균형을 강조하며, 희소성 기반 정보 검색에 대한 추가 연구를 위한 여러 방향을 제시합니다.
출처
- Linkup Research Releases SPARSEUPMarkTechPost · 2026년 9월 19일
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 2026년 9월 19일



