LinkupがSPARSEUPを公開、149Mパラメータのオープンソーススパース検索モデル、Apache 2.0ライセンス
Linkup ResearchはApache 2.0ライセンスのもとHugging FaceでSPARSEUPを公開しました;モデルは149百万パラメータのModernBERTを基盤とし、語彙トークンに対応する次元を持つスパースベクトルを生成し、LightOnのオープンデータで対照学習を行い、50件から選んだ7件のハードネガティブを使用しています。

SPARSEUP の紹介:オープンソースのスパース検索モデル
Linkup Research は SPARSEUP を Apache 2.0 ライセンスの下で公開し、モデルの重みは Hugging Face プラットフォームにアップロードされました。このリリースは、スパース検索技術の透明性とコミュニティ主導の開発への重要な一歩を示しています。ソースコードとパラメータは制限のないライセンス条件のもとで検査、改変、再配布が可能です。
SPARSEUP のアーキテクチャは、1億4900万パラメータを持つ ModernBERT バックボーン上に構築されています。従来の密集型リトリーバーが文書ごとに単一の密ベクトルを生成するのに対し、SPARSEUP は各次元がモデル語彙のトークンに直接結びついたスパースベクトルを生成します。そのため、表現は明確な言語的解釈を保持し、非ゼロエントリは特定トークンの存在または関連性を示します。
初期化戦略は二段階のプロセスです。まず、モデルは LateOn‑unsupervised チェックポイントから重みを継承します。この前身はすでに大規模コーパスでの教師なし事前学習を組み込んでいます。次に、SPARSEUP はオープンソースの LightOn データミックスを用いた対照的なファインチューニングを受けます。この段階では、各クエリに対して 1 件の正例文書と、50 件の候補プールから選ばれた 7 件のハードネガティブがペアリングされ、モデルの識別能力を高める設計となっています。
スパース性を制御するメカニズム
出力ベクトルのスパース性は、3 つの明示的なメカニズムで調整されます。第一のメカニズムは、ソフトマックス適用前にロジットに定数オフセット 15 を加えることで、多くのトークンスコアを活性化閾値以下に押し下げます。第二のメカニズムは、トークン位置ごとにアクティブな次元数を最大 12 に制限し、単一位置が過剰な非ゼロエントリを生むことを防止します。第三のメカニズムは、大文字小文字と空白のバリエーションを統合し、ケースやスペースだけが異なるトークンを単一次元にまとめます。これらの制御が組み合わさることで、解釈しやすく計算効率の高い表現が形成されます。
ケースとスペースの統合に伴い語彙サイズは縮小されます。約 5 万語のトークン集合から始まり、マージ処理を経て最終的に約 3.4 万次元となります。この削減はスパースベクトルの保存とインデックス作成コストに直接影響しつつ、検索に必要な基本的な語彙的区別は維持されます。
標準ベンチマークでの性能
Linkup は BEIR‑13 コレクション(MS MARCO サブセット除く)において、正規化割引累積利得 nDCG@10 が 56.4 であることを報告しています。著者らによれば、これは 1.5 億パラメータ未満のモデルとしては公表されている中で最高の結果です。この指標は標準的な BEIR テストクエリに対して評価プロトコルを適用した直接的な成果として提示されています。
SPARSEUP を同様のデータ基盤とバックボーンサイズを持つ密集型および遅延相互作用ベースラインと比較した場合、報告されたスコアは SPARSEUP が最先端の密集型手法を上回っていないことを示しています。具体的には DenseOn の構成が nDCG@10 で 57.9、LateOn の構成が同ベンチマークで 58.9 を記録しています。これらの数値は Linkup によって引用され、スパース性重視の設計にもかかわらず残る性能ギャップを示しています。
このギャップは、同等の学習条件下では密集表現が微妙な意味的類似性を捉える上で優位性を保つ可能性があることを示唆します。しかし、スパースモデルはインデックスサイズの削減や検索速度の向上といった明確なトレードオフを提供し、リソース制約が設計選択を支配するシナリオでは有用です。
Seismic インデックスによる速度とリコール
Linkup はスパースベクトル向けに最適化された Seismic というインデックス構造を導入しました。このインデックスを使用すると、同社は SPARSEUP が MS MARCO データセットに対する正確検索と比較して 97 % を超えるリコールを達成し、各クエリの処理時間は約 380 マイクロ秒であると主張しています。これらの数値は MS MARCO テストコレクション上で得られた実測値として提示されています。
著者は、報告されたレイテンシとリコールの数値はエンドユーザーが自らのデータ上で再現する必要があることを明示しています。この免責事項は、観測された性能がハードウェア構成、クエリ分布、データセット特性などの要因に依存し得ることを認め、検証なしに一般化できないことを示しています。
- Apache 2.0 ライセンスにより自由な再配布が保証される
- 149 M パラメータの ModernBERT バックボーン
- 50 件の候補から選択された 7 件のハードネガティブによる対照学習
- スパース性制御 3 つ:ロジットオフセット、位置ごとの上限、ケース・スペース統合
上記のリストは、SPARSEUP を他の検索モデルと差別化する主要な技術的選択肢を要約しています。各要素は、法的アクセシビリティ、モデル容量、学習ダイナミクス、最終表現のスパース性特性のいずれかに直接影響を与える設計決定を反映しています。
方法論的観点から見ると、固定数のハードネガティブを使用することで対照学習中の難易度が制御されます。しかし、ネガティブが 50 件のプールから抽出されるため、挑戦的な例の多様性が制限され、見たことのないクエリ‑文書ペアへの一般化能力が阻害される可能性があります。
スパース性メカニズムは次元削減に効果的ですが、情報価値のあるシグナルを除外するハードな閾値も課します。たとえばロジットオフセット 15 は多くのトークンスコアを活性化閾値以下に押し下げ、効率は向上するものの、特定クエリに対して重要な微細な語彙的手がかりが抑制されるリスクがあります。
ケースとスペースの統合による次元数の 5 万から 3.4 万への削減はインデックスを簡素化しますが、大文字小文字が意味を変える言語においては、統合されたトークンが別個の意味的重みを持つ可能性があります。このトレードオフは、圧縮と語彙的忠実性の間にある緊張関係を示しています。
SPARSEUP をより大規模な語彙や多言語環境に拡張できるかは未解決の課題です。現在の構成は単一言語のトークン集合で動作しており、スパース性制御を再評価しない限り次元数の過剰増加を防げません。
別の将来の研究領域として、スパース表現とハイブリッド検索パイプラインとの相互作用が挙げられます。SPARSEUP ベクトルと密集埋め込みを組み合わせることで、関連性の補完的側面を捉える可能性がありますが、具体的な統合戦略は実証的検証が必要です。
要約すると、SPARSEUP は透明性の高いオープンソースのスパース検索モデルを提供し、Seismic インデックス下で競争力のあるリコールと低レイテンシを実現しています。ベンチマークスコアはサブ 150 M パラメータ領域では尊敬に値するものの、トップクラスではありません。モデルの設計選択は、解釈可能性、効率性、検索効果のバランスを強調し、スパース性主導の情報検索に関するさらなる研究への複数の道筋を開きます。
出典
- Linkup Research Releases SPARSEUPMarkTechPost · 2026年9月19日
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 2026年9月19日



