Linkup brengt SPARSEUP uit, open source sparse retrieval‑model met 149 M parameters onder Apache 2.0
Linkup Research heeft SPARSEUP onder een Apache 2.0‑licentie op Hugging Face beschikbaar gesteld; het model bouwt op een ModernBERT‑basis van 149 miljoen parameters, genereert sparse vectoren waarbij elke dimensie overeenkomt met een vocabulaire‑token, en wordt getraind via contrastieve leermethodes op de open LightOn‑dataset met zeven moeilijke negatieve voorbeelden gekozen uit vijftig.

Introductie van SPARSEUP: een Open‑Source Sparse Retrieval Model
Linkup Research heeft SPARSEUP publiek beschikbaar gesteld onder de Apache 2.0‑licentie, en de modelgewichten zijn geüpload naar het Hugging Face‑platform. Deze release vormt een belangrijke stap richting transparante, door de gemeenschap gedreven ontwikkeling van sparse retrieval‑technieken, omdat de broncode en parameters kunnen worden geïnspecteerd, aangepast en opnieuw gedistribueerd zonder beperkende licentievoorwaarden.
De architectuur van SPARSEUP bouwt voort op een ModernBERT‑backbone met 149 miljoen parameters. In tegenstelling tot conventionele dense retrievers die één dense vector per document genereren, produceert SPARSEUP een sparse vector waarbij elke dimensie direct gekoppeld is aan een token in de vocabulaire van het model. Hierdoor behoudt de representatie een duidelijke linguïstische interpretatie, aangezien elke niet‑nul invoer de aanwezigheid of relevantie van een specifiek token aangeeft.
De initialisatiestrategie volgt een twee‑staps proces. Eerst erft het model gewichten van de LateOn‑unsupervised checkpoint, een voorganger die al ongesuperviseerd pre‑training op grote corpora bevat. Vervolgens ondergaat SPARSEUP contrastieve fine‑tuning met behulp van de open‑source LightOn datamix. Tijdens deze fase wordt elke query gekoppeld aan één positief document en zeven harde negatieven die worden geselecteerd uit een pool van vijftig kandidaten, een ontwerp dat bedoeld is om de discriminerende capaciteit van het model te scherpen.
Mechanismen die Sparsiteit Regelen
Drie expliciete mechanismen reguleren de sparsiteit van de output‑vectoren. Het eerste mechanisme voegt een constante offset van 15 toe aan de logits vóór het toepassen van de softmax, waardoor veel token‑scores onder de activatiedrempel worden geduwd. Het tweede mechanisme beperkt het aantal actieve dimensies per token‑positie tot twaalf, zodat geen enkele positie een excessief aantal niet‑nul invoer oplevert. Het derde mechanisme voegt varianten van hoofdlettergebruik en witruimte samen, waardoor tokens die alleen verschillen in kapitalisatie of spatiëring worden samengevoegd tot één dimensie. Samen vormen deze controles een representatie die zowel interpreteerbaar als computationeel efficiënt is.
De vocabulaire‑grootte wordt gereduceerd als onderdeel van de hoofdletter‑en‑spatie‑fusie. Beginnend met een geschatte tokenset van ongeveer 50.000 items, levert het samenvoegproces een uiteindelijke dimensionaliteit op van circa 34.000. Deze reductie beïnvloedt direct de opslag‑ en indexeringskosten van de sparse vectoren, terwijl de essentiële lexicale onderscheidingen die nodig zijn voor retrieval behouden blijven.
Prestaties op Standaard Benchmarks
Linkup meldt een genormaliseerde Discounted Cumulative Gain op rang 10 (nDCG@10) van 56,4 op de BEIR‑13‑collectie, exclusief de MS MARCO‑subset. Volgens de auteurs vormt dit cijfer het best openbaar gedeelde resultaat voor elk model met minder dan 150 miljoen parameters binnen deze benchmarkcategorie. De metric wordt gepresenteerd als een direct gevolg van het evaluatieprotocol toegepast op de standaard BEIR‑testqueries.
Bij vergelijking van SPARSEUP met dense en late‑interaction baselines die een vergelijkbare datagrondslag en backbone‑grootte delen, geven de gerapporteerde scores aan dat SPARSEUP de leidende dense benaderingen niet overtreft. Specifiek behaalt de DenseOn‑configuratie 57,9 nDCG@10, terwijl de LateOn‑configuratie 58,9 bereikt op dezelfde benchmark. Deze cijfers, geciteerd door Linkup, illustreren een prestatiekloof die blijft bestaan ondanks het op sparsiteit gerichte ontwerp.
De kloof suggereert dat, onder vergelijkbare trainingscondities, dense representaties een voordeel kunnen behouden bij het vastleggen van genuanceerde semantische gelijkenis. Het sparse model biedt echter duidelijke afwegingen, zoals een verkleinde indexgrootte en potentieel snellere retrieval, die waardevol kunnen zijn in scenario's waar resource‑beperkingen de ontwerpkeuzes domineren.
Snelheid en Recall met de Seismic Index
Linkup introduceert een indexeringsstructuur genaamd Seismic, geoptimaliseerd voor sparse vectoren. Met deze index beweert het bedrijf dat SPARSEUP een recall van meer dan 97 % behaalt ten opzichte van exacte zoekopdrachten op de MS MARCO‑dataset, terwijl elke query in ongeveer 380 microseconden wordt verwerkt. Deze cijfers worden gepresenteerd als empirische metingen verkregen op de MS MARCO‑testcollectie.
De auteurs vermelden expliciet dat de gerapporteerde latentie‑ en recall‑cijfers door eindgebruikers op hun eigen data moeten worden gereproduceerd. Deze disclaimer erkent dat de waargenomen prestaties kunnen afhangen van factoren zoals hardwareconfiguratie, query‑distributie en dataset‑kenmerken, en daarom niet zonder verificatie als algemeen geldig kunnen worden aangenomen.
- Apache 2.0‑licentie garandeert vrije herdistributie
- ModernBERT‑backbone van 149 M parameters
- Contrastieve training met zeven harde negatieven uit vijftig kandidaten
- Drie sparsiteitscontroles: logit‑offset, per‑positie limiet, hoofdletter‑spatie‑fusie
De bovenstaande lijst vat de kerntechnische keuzes samen die SPARSEUP onderscheiden van andere retrieval‑modellen. Elk element weerspiegelt een ontwerpbeslissing die direct invloed heeft op de juridische toegankelijkheid, de modelcapaciteit, de trainingsdynamiek of de sparsiteitskenmerken van de uiteindelijke representatie.
Vanuit methodologisch perspectief introduceert de afhankelijkheid van een vast aantal harde negatieven een gecontroleerd moeilijkheidsniveau tijdens contrastief leren. Omdat de negatieven echter uit een beperkte pool van vijftig worden gehaald, kan de diversiteit van uitdagende voorbeelden beperkt zijn, wat mogelijk de mogelijkheid van het model om te generaliseren naar ongeziene query‑documentparen belemmert.
De sparsiteitsmechanismen, hoewel effectief in het reduceren van dimensionaliteit, leggen ook harde drempels op die informatieve signalen kunnen weggooien. De logit‑offset van 15 duwt bijvoorbeeld veel token‑scores onder activatie, wat de efficiëntie kan verbeteren maar het risico met zich meebrengt subtiele lexicale aanwijzingen die relevant zijn voor bepaalde queries te onderdrukken.
De reductie van ongeveer 50 k naar 34 k dimensies via hoofdletter‑en‑spatie‑fusie vereenvoudigt de index, maar voegt ook tokens samen die een onderscheidende semantische waarde kunnen hebben in talen met hoofdlettergevoelige betekenissen. Deze afweging illustreert de spanning tussen compressie en linguïstische getrouwheid die inherent is aan sparse retrieval‑ontwerpen.
Open vragen blijven bestaan over de schaalbaarheid van SPARSEUP naar grotere vocabularia of meertalige omgevingen. De huidige configuratie werkt op een monolinguale tokenset; uitbreiding van de aanpak zou een heroverweging van de sparsiteitscontroles vereisen om buitensporige groei van dimensionaliteit te voorkomen.
Een ander gebied voor toekomstig onderzoek betreft de interactie tussen sparse representaties en hybride retrieval‑pijplijnen. Het is denkbaar dat het combineren van SPARSEUP‑vectoren met dense embeddings complementaire aspecten van relevantie kan vastleggen, hoewel de precieze integratiestrategie empirische validatie zou vereisen.
Samengevat draagt SPARSEUP bij met een transparant, open‑source sparse retrieval‑model dat een competitieve recall en lage latentie bereikt onder de Seismic‑index, terwijl het een benchmark‑score levert die respectabel maar niet leidend is binnen het sub‑150 M‑parameter regime. De ontwerpkeuzes van het model benadrukken de balans tussen interpreteerbaarheid, efficiëntie en retrieval‑effectiviteit, en openen verschillende paden voor verder onderzoek naar sparsiteit‑gedreven informatie‑retrieval.
Bronnen
- Linkup Research Releases SPARSEUPMarkTechPost · 19 september 2026
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 19 september 2026



