Linkup publie SPARSEUP, modèle de recherche sparse ouvert de 149 M de paramètres sous licence Apache 2.0
Linkup Research a rendu SPARSEUP disponible sur Hugging Face sous licence Apache 2.0 ; le modèle repose sur un socle ModernBERT de 149 millions de paramètres, produit des vecteurs sparse où chaque dimension correspond à un jeton de vocabulaire, et est entraîné par contraste sur le jeu de données ouvert de LightOn avec sept négatifs difficiles choisis parmi cinquante.

Présentation de SPARSEUP : un modèle de recherche parcimonieuse open‑source
Linkup Research a rendu SPARSEUP disponible publiquement sous licence Apache 2.0, et les poids du modèle ont été téléchargés sur la plateforme Hugging Face. Cette diffusion constitue une étape notable vers un développement transparent et communautaire des techniques de recherche parcimonieuse, le code source et les paramètres pouvant être inspectés, modifiés et redistribués sans contraintes de licence restrictives.
L’architecture de SPARSEUP repose sur un backbone ModernBERT contenant 149 millions de paramètres. Contrairement aux récupérateurs denses classiques qui génèrent un vecteur dense unique par document, SPARSEUP produit un vecteur parcimonieux dans lequel chaque dimension est directement liée à un jeton du vocabulaire du modèle. Ainsi, la représentation conserve une interprétation linguistique claire, chaque entrée non nulle signalant la présence ou la pertinence d’un jeton spécifique.
La stratégie d’initialisation suit un processus en deux étapes. D’abord, le modèle hérite des poids du point de contrôle LateOn‑unsupervised, un prédécesseur qui intègre déjà un pré‑entraînement non supervisé sur de grands corpus. Ensuite, SPARSEUP subit un affinement contrastif à l’aide du mélange de données LightOn open‑source. Au cours de cette phase, chaque requête est associée à un document positif et à sept négatifs difficiles sélectionnés parmi un pool de cinquante candidats, conception destinée à affiner la capacité discriminante du modèle.
Mécanismes de contrôle de la parcimonie
Trois mécanismes explicites régulent la parcimonie des vecteurs de sortie. Le premier ajoute un décalage constant de 15 aux logits avant l’application du softmax, poussant ainsi de nombreux scores de jetons en dessous du seuil d’activation. Le deuxième limite le nombre de dimensions actives par position de jeton à douze, garantissant qu’aucune position ne contribue à un nombre excessif d’entrées non nulles. Le troisième fusionne les variantes de casse et d’espacement, regroupant les jetons qui ne diffèrent que par la capitalisation ou l’espacement en une seule dimension. Ensemble, ces contrôles façonnent une représentation à la fois interprétable et efficace sur le plan computationnel.
La taille du vocabulaire subit une réduction dans le cadre de la fusion casse‑et‑espacement. Partant d’un ensemble de jetons d’environ 50 000 entrées, le processus de fusion aboutit à une dimension finale d’environ 34 000. Cette réduction influence directement le coût de stockage et d’indexation des vecteurs parcimonieux, tout en préservant les distinctions lexicales essentielles requises pour la recherche.
Performance sur les référentiels standards
Linkup rapporte un Discounted Cumulative Gain normalisé à rang 10 (nDCG@10) de 56,4 sur la collection BEIR‑13, à l’exclusion du sous‑ensemble MS MARCO. Selon les auteurs, ce chiffre constitue le meilleur résultat publiquement divulgué pour tout modèle de moins de 150 millions de paramètres dans cette catégorie de benchmark. La métrique est présentée comme le résultat direct du protocole d’évaluation appliqué aux requêtes de test standard BEIR.
En comparant SPARSEUP aux bases denses et d’interaction tardive qui partagent une fondation de données et une taille de backbone similaires, les scores rapportés indiquent que SPARSEUP ne dépasse pas les approches denses de pointe. Plus précisément, la configuration DenseOn atteint 57,9 nDCG@10, tandis que la configuration LateOn atteint 58,9 sur le même benchmark. Ces chiffres, cités par Linkup, illustrent un écart de performance qui persiste malgré la conception axée sur la parcimonie.
L’écart suggère que, dans des conditions d’entraînement comparables, les représentations denses peuvent conserver un avantage pour capter des similarités sémantiques subtiles. Cependant, le modèle parcimonieux offre des compromis distincts, tels qu’une taille d’index réduite et potentiellement une récupération plus rapide, ce qui peut être précieux dans les scénarios où les contraintes de ressources dominent les choix de conception.
Vitesse et rappel avec l’index sismique
Linkup introduit une structure d’indexation nommée Seismic, optimisée pour les vecteurs parcimonieux. Avec cet index, l’entreprise affirme que SPARSEUP atteint un rappel supérieur à 97 % par rapport à la recherche exacte sur le jeu de données MS MARCO, tout en traitant chaque requête en environ 380 microsecondes. Ces chiffres sont présentés comme des mesures empiriques obtenues sur la collection de test MS MARCO.
Les auteurs soulignent explicitement que les chiffres de latence et de rappel rapportés doivent être reproduits par les utilisateurs finaux sur leurs propres données. Cette mise en garde reconnaît que la performance observée peut dépendre de facteurs tels que la configuration matérielle, la distribution des requêtes et les caractéristiques du jeu de données, et ne peut donc pas être supposée généralisable sans vérification.
- Licence Apache 2.0 assure une redistribution libre
- Backbone ModernBERT de 149 M paramètres
- Entraînement contrastif avec sept négatifs durs parmi cinquante candidats
- Trois contrôles de parcimonie : décalage de logits, plafond par position, fusion casse‑espacement
La liste ci‑dessus résume les choix techniques essentiels qui différencient SPARSEUP des autres modèles de récupération. Chaque élément reflète une décision de conception influençant directement l’accessibilité juridique, la capacité du modèle, la dynamique d’entraînement ou les caractéristiques de parcimonie de la représentation finale.
D’un point de vue méthodologique, le recours à un nombre fixe de négatifs durs introduit un niveau de difficulté contrôlé pendant l’apprentissage contrastif. Cependant, comme les négatifs sont tirés d’un pool limité à cinquante, la diversité des exemples difficiles peut être restreinte, limitant potentiellement la capacité du modèle à se généraliser à des paires requête‑document inédites.
Les mécanismes de parcimonie, bien qu’efficaces pour réduire la dimensionalité, imposent également des seuils durs qui pourraient éliminer des signaux informatifs. Le décalage de logits de 15, par exemple, repousse de nombreux scores de jetons en dessous de l’activation, ce qui peut améliorer l’efficacité mais au risque de supprimer des indices lexicaux subtils pertinents pour certaines requêtes.
La réduction d’environ 50 k à 34 k dimensions via la fusion casse‑et‑espacement simplifie l’index mais fusionne aussi des jetons pouvant porter des poids sémantiques distincts dans des langues où la casse a une signification. Ce compromis illustre la tension entre compression et fidélité linguistique inhérente aux conceptions de recherche parcimonieuse.
Des questions ouvertes subsistent quant à la scalabilité de SPARSEUP vers des vocabulaires plus larges ou des contextes multilingues. La configuration actuelle fonctionne sur un jeu de jetons monolingue ; étendre l’approche nécessiterait de réexaminer les contrôles de parcimonie afin d’éviter une croissance excessive de la dimensionalité.
Un autre axe d’investigation future concerne l’interaction entre les représentations parcimonieuses et les pipelines de récupération hybrides. Il est concevable que la combinaison des vecteurs SPARSEUP avec des embeddings denses puisse capturer des aspects complémentaires de la pertinence, bien que la stratégie d’intégration précise doive être validée empiriquement.
En résumé, SPARSEUP apporte un modèle de recherche parcimonieuse transparent et open‑source qui atteint un rappel compétitif et une faible latence sous l’index Seismic, tout en délivrant un score de benchmark respectable mais non leader dans le régime de moins de 150 M paramètres. Les choix de conception du modèle soulignent l’équilibre entre interprétabilité, efficacité et efficacité de recherche, et ouvrent plusieurs voies pour de futures recherches sur la récupération d’information guidée par la parcimonie.
Sources
- Linkup Research Releases SPARSEUPMarkTechPost · 19 septembre 2026
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 19 septembre 2026



