Linkup lança SPARSEUP, modelo aberto de busca esparsa com 149 M de parâmetros sob Apache 2.0
Linkup Research disponibilizou SPARSEUP no Hugging Face sob licença Apache 2.0; o modelo usa a base ModernBERT de 149 milhões de parâmetros, produz vetores esparsos em que cada dimensão corresponde a um token do vocabulário e foi treinado por contraste com o conjunto aberto da LightOn usando sete negativos difíceis selecionados entre cinquenta.

Apresentando o SPARSEUP: Um Modelo de Recuperação Esparsa de Código Aberto
A Linkup Research disponibilizou o SPARSEUP publicamente sob a licença Apache 2.0, e os pesos do modelo foram enviados para a plataforma Hugging Face. Esta liberação marca um passo notável rumo ao desenvolvimento transparente e impulsionado pela comunidade de técnicas de recuperação esparsa, já que o código‑fonte e os parâmetros podem ser inspecionados, modificados e redistribuídos sem restrições de licenciamento.
A arquitetura do SPARSEUP baseia‑se em um backbone ModernBERT que contém 149 milhões de parâmetros. Diferentemente dos recuperadores densos convencionais que geram um único vetor denso por documento, o SPARSEUP produz um vetor esparso em que cada dimensão está diretamente vinculada a um token no vocabulário do modelo. Consequentemente, a representação preserva uma interpretação linguística clara, pois cada entrada não‑zero sinaliza a presença ou relevância de um token específico.
A estratégia de inicialização segue um processo de duas etapas. Primeiro, o modelo herda pesos do checkpoint LateOn‑unsupervised, um predecessor que já incorpora pré‑treinamento não supervisionado em grandes corpora. Segundo, o SPARSEUP passa por ajuste fino contrastivo usando a mistura de dados LightOn de código aberto. Durante esta fase, cada consulta é pareada com um documento positivo e sete negativos difíceis selecionados a partir de um pool de cinquenta candidatos, um design destinado a aprimorar a capacidade discriminativa do modelo.
Mecanismos de Controle da Esparsidade
Três mecanismos explícitos regulam a esparsidade dos vetores de saída. O primeiro mecanismo adiciona um deslocamento constante de 15 aos logits antes de aplicar o softmax, empurrando efetivamente muitas pontuações de token abaixo do limiar de ativação. O segundo mecanismo limita o número de dimensões ativas por posição de token a doze, garantindo que nenhuma posição única contribua com um número excessivo de entradas não‑zero. O terceiro mecanismo mescla variantes de caixa e espaço em branco, colapsando tokens que diferem apenas em capitalização ou espaçamento em uma única dimensão. Juntos, esses controles moldam uma representação que é tanto interpretável quanto computacionalmente eficiente.
O tamanho do vocabulário sofre uma redução como parte da fusão de caixa e espaçamento. Partindo de um conjunto aproximado de 50 000 tokens, o processo de mesclagem resulta em uma dimensionalidade final de cerca de 34 000. Essa redução influencia diretamente o custo de armazenamento e indexação dos vetores esparsos, ao mesmo tempo que preserva as distinções lexicais essenciais necessárias para a recuperação.
Desempenho em Benchmarks Padrão
A Linkup relata um Discounted Cumulative Gain normalizado na posição 10 (nDCG@10) de 56,4 na coleção BEIR‑13, excluindo o subconjunto MS MARCO. Segundo os autores, esse número constitui o melhor resultado divulgado publicamente para qualquer modelo com menos de 150 milhões de parâmetros dentro desta categoria de benchmark. A métrica é apresentada como resultado direto do protocolo de avaliação aplicado às consultas padrão de teste do BEIR.
Ao comparar o SPARSEUP com linhas de base densas e de interação tardia que compartilham uma base de dados e tamanho de backbone semelhantes, os escores relatados indicam que o SPARSEUP não supera as abordagens densas líderes. Especificamente, a configuração DenseOn atinge 57,9 nDCG@10, enquanto a configuração LateOn chega a 58,9 no mesmo benchmark. Esses números, citados pela Linkup, ilustram uma lacuna de desempenho que persiste apesar do design focado em esparsidade.
A lacuna sugere que, sob condições de treinamento comparáveis, representações densas podem manter uma vantagem na captura de semelhanças semânticas sutis. Contudo, o modelo esparso oferece trade‑offs distintos, como tamanho de índice reduzido e potencialmente recuperação mais rápida, o que pode ser valioso em cenários onde restrições de recursos dominam as escolhas de design.
Velocidade e Recall com o Índice Sísmico
A Linkup introduz uma estrutura de indexação chamada Seismic, otimizada para vetores esparsos. Usando esse índice, a empresa afirma que o SPARSEUP atinge um recall superior a 97 % em relação à busca exata no conjunto de dados MS MARCO, enquanto processa cada consulta em aproximadamente 380 microssegundos. Esses números são apresentados como medições empíricas obtidas na coleção de teste MS MARCO.
Os autores observam explicitamente que os valores de latência e recall relatados devem ser reproduzidos pelos usuários finais em seus próprios dados. Essa ressalva reconhece que o desempenho observado pode depender de fatores como configuração de hardware, distribuição de consultas e características do conjunto de dados, e, portanto, não pode ser assumido como generalizável sem verificação.
- Licença Apache 2.0 garante redistribuição livre
- Backbone ModernBERT de 149 M de parâmetros
- Treinamento contrastivo com sete negativos difíceis de cinquenta candidatos
- Três controles de esparsidade: deslocamento de logits, limite por posição, fusão de caixa‑espaço
A lista acima resume as escolhas técnicas centrais que diferenciam o SPARSEUP de outros modelos de recuperação. Cada elemento reflete uma decisão de design que influencia diretamente a acessibilidade legal, a capacidade do modelo, a dinâmica de treinamento ou as características de esparsidade da representação final.
De uma perspectiva metodológica, a dependência de um número fixo de negativos difíceis introduz um nível controlado de dificuldade durante o aprendizado contrastivo. Contudo, como os negativos são extraídos de um pool limitado de cinquenta, a diversidade de exemplos desafiadores pode ser restrita, potencialmente limitando a capacidade do modelo de generalizar para pares consulta‑documento nunca vistos.
Os mecanismos de esparsidade, embora eficazes na redução da dimensionalidade, também impõem limiares rígidos que podem descartar sinais informativos. O deslocamento de logits de 15, por exemplo, empurra muitas pontuações de token abaixo da ativação, o que pode melhorar a eficiência, mas ao custo de suprimir pistas lexicais sutis relevantes para certas consultas.
A redução de aproximadamente 50 k para 34 k dimensões por meio da fusão de caixa e espaçamento simplifica o índice, mas também mescla tokens que poderiam carregar peso semântico distinto em línguas com significados sensíveis a maiúsculas. Esse trade‑off ilustra a tensão entre compressão e fidelidade linguística inerente aos designs de recuperação esparsa.
Perguntas abertas permanecem quanto à escalabilidade do SPARSEUP para vocabulários maiores ou contextos multilíngues. A configuração atual opera sobre um conjunto de tokens monolíngue; estender a abordagem exigiria reavaliar os controles de esparsidade para evitar crescimento excessivo da dimensionalidade.
Outra área para investigação futura diz respeito à interação entre representações esparsas e pipelines de recuperação híbridos. É concebível que a combinação dos vetores SPARSEUP com embeddings densos capture aspectos complementares de relevância, embora a estratégia de integração precisa ser validada empiricamente.
Em resumo, o SPARSEUP contribui com um modelo de recuperação esparsa transparente e de código aberto que atinge recall competitivo e baixa latência sob o índice Seismic, ao mesmo tempo em que entrega um score de benchmark respeitável, porém não líder, dentro do regime de menos de 150 M de parâmetros. As escolhas de design do modelo destacam o equilíbrio entre interpretabilidade, eficiência e eficácia de recuperação, e abrem várias avenidas para pesquisa adicional sobre recuperação de informação orientada por esparsidade.
Fontes
- Linkup Research Releases SPARSEUPMarkTechPost · 19 de setembro de 2026
- Linkup-Platform/linkup-sparseup-embed-v1Hugging Face · 19 de setembro de 2026



