Linkup lanza SPARSEUP, modelo abierto de recuperación escasa de 149 M parámetros bajo Apache 2.0
Linkup Research ha puesto a disposición SPARSEUP en Hugging Face bajo licencia Apache 2.0; el modelo se basa en ModernBERT con 149 millones de parámetros, genera vectores escasos donde cada dimensión corresponde a un token del vocabulario y se entrena por contraste con datos abiertos de LightOn usando siete negativos duros seleccionados entre cincuenta.

Presentando SPARSEUP: Un modelo de recuperación escasa de código abierto
Linkup Research ha puesto SPARSEUP a disposición del público bajo la licencia Apache 2.0, y los pesos del modelo se han subido a la plataforma Hugging Face. Esta publicación marca un paso notable hacia un desarrollo transparente y comunitario de técnicas de recuperación escasa, ya que el código fuente y los parámetros pueden inspeccionarse, modificarse y redistribuirse sin restricciones de licencia restrictivas.
La arquitectura de SPARSEUP se basa en una columna vertebral ModernBERT que contiene 149 millones de parámetros. A diferencia de los recuperadores densos convencionales que generan un único vector denso por documento, SPARSEUP produce un vector escaso en el que cada dimensión está directamente vinculada a un token del vocabulario del modelo. En consecuencia, la representación conserva una interpretación lingüística clara, ya que cada entrada distinta de cero indica la presencia o relevancia de un token específico.
La estrategia de inicialización sigue un proceso de dos etapas. Primero, el modelo hereda pesos del punto de control LateOn‑unsupervised, un predecesor que ya incorpora pre‑entrenamiento no supervisado en grandes corpus. Segundo, SPARSEUP se somete a un ajuste fino contrastivo utilizando la mezcla de datos LightOn de código abierto. Durante esta fase, cada consulta se empareja con un documento positivo y siete negativos duros que se seleccionan de un conjunto de cincuenta candidatos, un diseño destinado a agudizar la capacidad discriminativa del modelo.
Mecanismos que controlan la escasez
Tres mecanismos explícitos regulan la escasez de los vectores de salida. El primer mecanismo añade un desplazamiento constante de 15 a los logits antes de aplicar la softmax, empujando efectivamente muchas puntuaciones de tokens por debajo del umbral de activación. El segundo mecanismo limita el número de dimensiones activas por posición de token a doce, asegurando que ninguna posición única contribuya con un número excesivo de entradas distintas de cero. El tercer mecanismo fusiona variantes de mayúsculas y espacios en blanco, colapsando tokens que difieren solo en capitalización o espaciado en una sola dimensión. En conjunto, estos controles configuran una representación que es tanto interpretable como computacionalmente eficiente.
El tamaño del vocabulario se reduce como parte de la fusión de mayúsculas y espaciado. Partiendo de un conjunto aproximado de 50 000 tokens, el proceso de fusión produce una dimensionalidad final de alrededor de 34 000. Esta reducción influye directamente en el coste de almacenamiento e indexación de los vectores escasos, mientras preserva las distinciones léxicas esenciales requeridas para la recuperación.
Rendimiento en benchmarks estándar
Linkup informa de un Discounted Cumulative Gain normalizado en el rango 10 (nDCG@10) de 56,4 en la colección BEIR‑13, excluyendo el subconjunto MS MARCO. Según los autores, esta cifra constituye el mejor resultado divulgado públicamente para cualquier modelo con menos de 150 millones de parámetros dentro de esta categoría de benchmark. La métrica se presenta como un resultado directo del protocolo de evaluación aplicado a las consultas estándar de prueba de BEIR.
Al comparar SPARSEUP con líneas base densas y de interacción tardía que comparten una base de datos y un tamaño de columna vertebral similar, los puntajes reportados indican que SPARSEUP no supera a los enfoques densos líderes. Específicamente, la configuración DenseOn alcanza 57,9 nDCG@10, mientras que la configuración LateOn llega a 58,9 en el mismo benchmark. Estas cifras, citadas por Linkup, ilustran una brecha de rendimiento que persiste a pesar del diseño centrado en la escasez.
La brecha sugiere que, bajo condiciones de entrenamiento comparables, las representaciones densas pueden mantener una ventaja en la captura de similitud semántica matizada. Sin embargo, el modelo escaso ofrece compensaciones distintas, como un tamaño de índice reducido y potencialmente una recuperación más rápida, lo que podría ser valioso en escenarios donde las limitaciones de recursos dominan las decisiones de diseño.
Velocidad y recall con el índice Sísmico
Linkup introduce una estructura de indexación llamada Sísmico, optimizada para vectores escasos. Con este índice, la empresa afirma que SPARSEUP alcanza un recall superior al 97 % respecto a la búsqueda exacta en el conjunto de datos MS MARCO, mientras procesa cada consulta en aproximadamente 380 microsegundos. Estos números se presentan como mediciones empíricas obtenidas en la colección de prueba MS MARCO.
Los autores señalan explícitamente que las cifras de latencia y recall reportadas deben ser reproducidas por los usuarios finales en sus propios datos. Esta advertencia reconoce que el rendimiento observado puede depender de factores como la configuración de hardware, la distribución de consultas y las características del conjunto de datos, y por lo tanto no puede asumirse que se generalice sin verificación.
- La licencia Apache 2.0 garantiza la redistribución libre
- Columna vertebral ModernBERT de 149 M de parámetros
- Entrenamiento contrastivo con siete negativos duros de cincuenta candidatos
- Tres controles de escasez: desplazamiento de logits, límite por posición, fusión de mayúsculas‑espaciado
La lista anterior resume las elecciones técnicas centrales que diferencian a SPARSEUP de otros modelos de recuperación. Cada elemento refleja una decisión de diseño que influye directamente en la accesibilidad legal, la capacidad del modelo, la dinámica de entrenamiento o las características de escasez de la representación final.
Desde una perspectiva metodológica, la dependencia de un número fijo de negativos duros introduce un nivel controlado de dificultad durante el aprendizaje contrastivo. Sin embargo, dado que los negativos se extraen de un conjunto limitado de cincuenta, la diversidad de ejemplos desafiantes puede estar restringida, lo que potencialmente limita la capacidad del modelo para generalizar a pares consulta‑documento no vistos.
Los mecanismos de escasez, aunque eficaces para reducir la dimensionalidad, también imponen umbrales rígidos que podrían descartar señales informativas. El desplazamiento de logits de 15, por ejemplo, empuja muchas puntuaciones de tokens por debajo de la activación, lo que puede mejorar la eficiencia pero con el riesgo de suprimir pistas léxicas sutiles relevantes para ciertas consultas.
La reducción de aproximadamente 50 k a 34 k dimensiones mediante la fusión de mayúsculas y espaciado simplifica el índice pero también fusiona tokens que podrían poseer peso semántico distinto en lenguas con significados sensibles a la capitalización. Esta compensación ilustra la tensión entre compresión y fidelidad lingüística inherente a los diseños de recuperación escasa.
Quedan preguntas abiertas sobre la escalabilidad de SPARSEUP a vocabularios más grandes o entornos multilingües. La configuración actual opera sobre un conjunto de tokens monolingüe; ampliar el enfoque requeriría reevaluar los controles de escasez para evitar un crecimiento excesivo de la dimensionalidad.
Otra área de investigación futura concierne la interacción entre representaciones escasas y canalizaciones de recuperación híbridas. Es concebible que combinar vectores SPARSEUP con incrustaciones densas pueda capturar aspectos complementarios de relevancia, aunque la estrategia de integración precisa necesitaría validación empírica.
En resumen, SPARSEUP aporta un modelo de recuperación escasa transparente y de código abierto que logra un recall competitivo y baja latencia bajo el índice Sísmico, al tiempo que ofrece una puntuación de benchmark respetable pero no líder dentro del rango de menos de 150 M de parámetros. Las decisiones de diseño del modelo resaltan el equilibrio entre interpretabilidad, eficiencia y efectividad de recuperación, y abren varias vías para investigaciones posteriores sobre la recuperación de información impulsada por la escasez.
Fuentes
- Linkup Research Releases SPARSEUPMarkTechPost · 19 de septiembre de 2026
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 19 de septiembre de 2026



