Linkup发布SPARSEUP,开放源码稀疏检索模型,参数量149M,采用Apache 2.0许可证
Linkup Research在Hugging Face上以Apache 2.0许可证公开了SPARSEUP模型;该模型基于149百万参数的ModernBERT骨架,生成每个维度对应词表词元的稀疏向量,并在LightOn开放数据集上通过对比学习训练,使用从五十个样本中挑选的七个困难负例。

介绍 SPARSEUP:一个开源稀疏检索模型
Linkup Research 已在 Apache 2.0 许可证下公开发布了 SPARSEUP,模型权重已上传至 Hugging Face 平台。此发布标志着稀疏检索技术向透明、社区驱动开发迈出的重要一步,因为源代码和参数可以在没有限制性许可证约束的情况下被检查、修改和再分发。
SPARSEUP 的架构基于 ModernBERT 主干,包含 1.49 亿参数。不同于传统的密集检索器为每篇文档生成单一的密集向量,SPARSEUP 生成的稀疏向量中每个维度直接对应模型词表中的一个 token。因此,该表示保留了明确的语言学解释,每个非零条目都指示特定 token 的出现或相关性。
初始化策略遵循两阶段过程。首先,模型从 LateOn‑unsupervised 检查点继承权重,该前身已经在大规模语料上完成了无监督预训练。其次,SPARSEUP 使用开源的 LightOn 数据混合进行对比微调。在此阶段,每个查询与一个正例文档以及七个从五十个候选中挑选的困难负例配对,旨在提升模型的判别能力。
控制稀疏性的机制
有三种显式机制调节输出向量的稀疏程度。第一种机制在应用 softmax 之前向 logits 加上常数偏移 15,有效地将许多 token 分数压低到激活阈值以下。第二种机制将每个 token 位置的活跃维度上限设为十二,确保单一位置不会贡献过多非零条目。第三种机制合并大小写和空格的变体,将仅在大小写或空格上不同的 token 合并为同一维度。这些控制共同塑造了既可解释又计算高效的表示。
词表规模在大小写与空格融合过程中被缩减。起始约有 5 万条 token,合并后最终维度约为 3.4 万。此缩减直接影响稀疏向量的存储和索引成本,同时保留了检索所需的关键词汇区分。
标准基准上的性能
Linkup 报告称,在 BEIR‑13 集合(不含 MS MARCO 子集)上,SPARSEUP 的归一化折扣累计增益 nDCG@10 为 56.4。作者指出,这一数值是目前公开的、参数少于 1.5 亿的模型在该基准类别中取得的最佳结果。该指标直接来源于对标准 BEIR 测试查询执行的评估协议。
在将 SPARSEUP 与使用相似数据基础和主干规模的密集以及后交互基线进行比较时,报告的分数显示 SPARSEUP 未能超越领先的密集方法。具体而言,DenseOn 配置获得 57.9 的 nDCG@10,而 LateOn 配置在同一基准上达到 58.9。这些数字由 Linkup 引用,说明即使在稀疏设计下仍存在性能差距。
该差距暗示,在相似的训练条件下,密集表示在捕捉细微语义相似性方面可能仍具优势。然而,稀疏模型提供了不同的权衡,如更小的索引体积和潜在更快的检索速度,这在资源受限的场景中可能具有价值。
使用 Seismic 索引的速度与召回率
Linkup 引入了一种名为 Seismic 的索引结构,专为稀疏向量优化。使用该索引,公司声称 SPARSEUP 在 MS MARCO 数据集上相对于精确搜索的召回率超过 97%,且每个查询的处理时间约为 380 微秒。这些数字被呈现为在 MS MARCO 测试集合上获得的实测结果。
作者明确指出,报告的延迟和召回率必须由最终用户在自己的数据上复现。此免责声明承认观察到的性能可能受硬件配置、查询分布和数据集特性等因素影响,因此不能在未经验证的情况下假设其普遍适用。
- Apache 2.0 许可证确保自由再分发
- ModernBERT 主干拥有 1.49 亿参数
- 使用七个来自五十个候选的困难负例进行对比训练
- 三种稀疏控制:logit 偏移、每位置上限、大小写‑空格融合
上述列表概括了使 SPARSEUP 与其他检索模型区别开的核心技术选择。每一项都反映了直接影响法律可访问性、模型容量、训练动态或最终表示稀疏特性的设计决策。
从方法论角度看,固定数量的困难负例在对比学习过程中引入了受控的难度。然而,由于负例仅从五十个候选中抽取,挑战性示例的多样性可能受限,从而可能限制模型对未见查询‑文档对的泛化能力。
稀疏机制虽能有效降低维度,但也施加了硬阈值,可能会丢弃有价值的信号。例如,logit 偏移 15 会将许多 token 分数压低到激活以下,这虽提升了效率,却有抑制某些查询相关细微词汇线索的风险。
通过大小写‑空格融合将维度从约 5 万降至 3.4 万虽简化了索引,但也合并了在区分大小写意义的语言中可能承载不同语义权重的 token。此权衡展示了稀疏检索设计中压缩与语言忠实性之间的张力。
关于 SPARSEUP 在更大词表或多语言环境下的可扩展性仍存未解问题。当前配置基于单语 token 集;若要扩展该方法,需要重新评估稀疏控制,以防止维度过度增长。
另一个未来研究方向是稀疏表示与混合检索管道之间的交互。将 SPARSEUP 向量与密集嵌入结合,可能捕获互补的相关性方面,尽管具体的集成策略仍需通过实验证实。
总之,SPARSEUP 提供了一个透明的开源稀疏检索模型,在 Seismic 索引下实现了竞争性的召回率和低延迟,同时在子 1.5 亿参数区间内取得了可观但非领先的基准得分。模型的设计选择凸显了解释性、效率与检索效果之间的平衡,并为稀疏驱动的信息检索进一步研究开辟了多条路径。
信息来源
- Linkup Research Releases SPARSEUPMarkTechPost · 2026年9月19日
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 2026年9月19日



