SoL-Pi leva eficiência de agentes de programação para o harness
Pesquisadores da NVIDIA, NTU e MIT relatam que o SoL-Pi reduz tráfego de tokens e custo de API do agente Pi no EdgeBench sem modificar o agente subjacente.

SoL-Pi é uma nova camada de eficiência para o agente de programação de código aberto Pi, lançada por pesquisadores da NVIDIA, da NTU e do MIT em 21 de setembro. A principal mudança é arquitetural: em vez de alterar o modelo ou o próprio agente Pi, ela modifica o harness ao redor do agente. Os autores relatam que, na avaliação EdgeBench com 51 tarefas, a pilha completa do SoL-Pi reduz o tráfego de tokens em 44,7% a 49,0% e diminui o custo de API em cerca de 33%, mantendo cerca de 94% da pontuação média do Pi.
De mudanças no modelo a mudanças no harness
O trabalho mira um ponto de pressão conhecido para agentes de programação: a interação repetida com ambientes pode gerar históricos longos, observações repetidas e chamadas de modelo caras. O SoL-Pi não afirma introduzir um novo modelo de programação. Ele é descrito como uma extensão sob licença MIT que funciona com uma versão não modificada do Pi. Os testes reportados usaram o Pi 0.85.1 e Node.js 22.19 ou posterior.
Essa distinção importa porque esforços de eficiência em agentes de programação podem ocorrer em vários níveis. Um fornecedor de modelo pode mudar o modelo. Um desenvolvedor de agente pode alterar a lógica de planejamento ou de uso de ferramentas do agente. Um operador de benchmark pode medir o desempenho de ponta a ponta em um ambiente fixo. O SoL-Pi fica na segunda camada, ao redor do agente, mas os números reportados continuam sendo resultados de benchmark informados pelos autores, não medições independentes.
Os pesquisadores usaram um processo de autopesquisa por IA para buscar mecanismos de eficiência. Segundo o artigo, esse processo explorou 152 direções em seis famílias, 535 ambientes executáveis, mais de 3.000 execuções e mais de 60.000 interações entre agente e ambiente. A partir dessa busca, quatro mecanismos sobreviveram: Action Fusion, Online Context Compact, ObservationPack e um Evidence-Preserving Reducer.
O sistema resultante pode ser lido como uma tentativa de reduzir desperdício na conversa entre um agente de programação e seu ambiente. Em vez de pedir que o modelo subjacente se torne mais barato ou mais conciso por si só, o SoL-Pi restringe, comprime ou reorganiza o que o modelo vê e faz por meio do harness. A alegação dos autores, portanto, não é apenas que o Pi pode ficar mais barato em um benchmark, mas que parte da eficiência pode ser extraída sem retreinar ou substituir o agente.
Quatro mecanismos ao redor do Pi
Action Fusion é um dos quatro mecanismos selecionados pelo processo de autopesquisa. Com base no nome e em sua posição na pilha do harness, seu papel é reduzir padrões de ação ineficientes ao combinar ou simplificar operações que, de outro modo, seriam tratadas separadamente. O material verificado não fornece detalhe de implementação além de identificá-lo como um dos mecanismos sobreviventes, portanto suas regras internas precisas não devem ser inferidas além disso.
Online Context Compact trata do contexto carregado ao longo da execução do agente. Agentes de programação muitas vezes acumulam informações enquanto inspecionam arquivos, executam comandos, observam saídas e revisam planos. A posição declarada do mecanismo no SoL-Pi indica que ele compacta o contexto durante a execução, com o objetivo de reduzir o tráfego de tokens e, ao mesmo tempo, preservar informações suficientes para que o agente continue resolvendo tarefas.
ObservationPack é outro mecanismo no lado do harness. Seu nome indica atenção à forma como observações do ambiente são empacotadas antes de chegar ao agente. Em um ciclo de agente de programação, observações brutas podem ser verbosas, repetidas ou mal estruturadas para a próxima chamada de modelo. O mecanismo faz parte da pilha reportada pelos autores para reduzir o tráfego de tokens, embora o resumo não sustente uma descrição mais específica de suas escolhas de formatação.
O Evidence-Preserving Reducer é o quarto mecanismo sobrevivente. Seu nome destaca uma troca central em compressão para sistemas agênticos: reduzir texto pode remover informação que depois se revela necessária. Ao preservar evidências, o redutor é posicionado como uma proteção contra comprimir e eliminar a base das decisões. O resultado medido relatado pelos autores é que a pilha completa mantém cerca de 94% da pontuação média do Pi no EdgeBench, enquanto reduz tráfego de tokens e custo.
O que os números de benchmark mostram
No EdgeBench, o principal resultado reportado pelos autores é uma redução no tráfego de tokens de 44,7% a 49,0% para a pilha completa do SoL-Pi. A mesma avaliação relata custo de API cerca de 33% menor. Como o custo de API está ligado a chamadas de modelo e uso de tokens, o resultado é consistente com o objetivo do sistema: reduzir a quantidade de texto e a sobrecarga de interação enviados pelo ciclo do agente, preservando boa parte da pontuação no benchmark.
O número de desempenho retido também é importante. Os autores relatam que o SoL-Pi mantém cerca de 94% da pontuação média do Pi na avaliação EdgeBench com 51 tarefas. Isso não é o mesmo que dizer que o desempenho não mudou, e não é uma validação independente. Significa que, nas condições reportadas pelos autores, as reduções no lado do harness vieram com uma perda de pontuação medida em relação ao Pi, ainda preservando a maior parte da pontuação média.
O Terminal-Bench 4 oferece um segundo dado reportado, com outro formato. Nele, o SoL-Pi resolveu 15 tarefas, em comparação com 18 do Pi, enquanto reduziu o custo total em 26,3%. Esse resultado mostra a troca de maneira mais clara: menos tarefas resolvidas em troca de custo total menor. Ele também alerta contra interpretar a redução de custo no EdgeBench como um ganho universal e sem contrapartida em todos os benchmarks.
A transferência entre modelos é descrita como preliminar. Isso limita a generalidade da alegação. Um método de harness que funciona bem com um agente e uma versão testada não necessariamente leva o mesmo equilíbrio entre eficiência e desempenho para outras combinações de modelos e agentes. Os fatos verificados sustentam a afirmação de que o SoL-Pi funciona com uma versão não modificada do Pi e foi testado com o Pi 0.85.1, mas não estabelecem transferência ampla entre sistemas de agentes de programação.
Implicações práticas e limites
A implicação prática é que operadores de agentes de programação podem ter outro lugar para buscar eficiência: o harness do ambiente. Se observações repetidas, contexto verboso e padrões de ação ineficientes forem grandes geradores de custo, um wrapper pode reduzir o uso sem mudar a versão do próprio agente. A licença MIT do SoL-Pi e sua compatibilidade com o Pi não modificado são relevantes aqui porque tornam a abordagem uma extensão separável, e não um desenho de agente bifurcado.
Ao mesmo tempo, a evidência é delimitada pelos benchmarks reportados. Os números do EdgeBench são resultados informados pelos autores em 51 tarefas. Os números do Terminal-Bench 4 também são reportados pelos autores e mostram uma contagem de tarefas resolvidas menor que a do Pi. O processo de autopesquisa foi amplo nos números fornecidos, mas não substitui replicação independente. Os números demonstram uma troca entre eficiência e desempenho reportada sob testes específicos; não provam que todas as cargas de trabalho de agentes de programação terão a mesma redução de custo ou a mesma pontuação retida.
O ponto mais amplo é metodológico. O SoL-Pi reformula parte da otimização de agentes de programação como engenharia de harness: controlar ações, compactar contexto, empacotar observações e reduzir evidências sem descartar a informação necessária para agir. O custo de API cerca de um terço menor no EdgeBench é o resultado destacado, mas a questão mais duradoura é se mecanismos desse tipo, no lado do harness, podem ser medidos de forma consistente entre agentes, modelos e tarefas sem esconder modos de falha por trás da compressão.
Fontes
- NVIDIA introduces SoL-PiMarkTechPost · 21 de setembro de 2026
- SoL-Pi: Self-Optimizing Language-Agent HarnessesarXiv · 21 de setembro de 2026



