SoL-Pi verplaatst efficiëntie van coding agents naar de harness
Onderzoekers van NVIDIA, NTU en MIT melden dat SoL-Pi op EdgeBench het tokenverkeer en de API-kosten van de Pi-codingagent verlaagt zonder de agent zelf te wijzigen.

SoL-Pi is een nieuwe efficiëntielaag voor de opensource Pi-codingagent, uitgebracht door onderzoekers van NVIDIA, NTU en MIT op 21 september. De belangrijkste verschuiving is architecturaal: in plaats van het model of de Pi-agent zelf te veranderen, past SoL-Pi de harness rond de agent aan. De auteurs melden dat de volledige SoL-Pi-stack op de EdgeBench-evaluatie met 51 taken het tokenverkeer met 44,7% tot 49,0% vermindert en de API-kosten met ongeveer 33% verlaagt, terwijl ongeveer 94% van Pi’s gemiddelde score behouden blijft.
Van modelwijzigingen naar harnesswijzigingen
Het werk richt zich op een bekend knelpunt voor coding agents: hun herhaalde interactie met omgevingen kan lange geschiedenissen, terugkerende observaties en kostbare modelaanroepen opleveren. SoL-Pi claimt niet een nieuw codingmodel te introduceren. Het wordt beschreven als een extensie onder MIT-licentie die werkt met een ongewijzigde Pi-release. De gerapporteerde tests gebruikten Pi 0.85.1 en Node.js 22.19 of later.
Dat onderscheid is relevant omdat efficiëntiewerk bij coding agents op meerdere niveaus kan plaatsvinden. Een modelaanbieder kan het model aanpassen. Een agentontwikkelaar kan de planning of de logica voor toolgebruik van de agent veranderen. Een benchmarkoperator kan end-to-endprestaties meten in een vaste omgeving. SoL-Pi bevindt zich in de tweede laag rond de agent, maar de gerapporteerde cijfers blijven benchmarkresultaten die door de auteurs zijn gemeld, geen onafhankelijke metingen.
De onderzoekers gebruikten een AI-gestuurd auto-onderzoeksproces om naar efficiëntiemechanismen te zoeken. Volgens het paper verkende dat proces 152 richtingen binnen zes families, 535 uitvoerbare omgevingen, meer dan 3.000 runs en meer dan 60.000 interacties tussen agent en omgeving. Uit die zoektocht bleven vier mechanismen over: Action Fusion, Online Context Compact, ObservationPack en een Evidence-Preserving Reducer.
Het resulterende systeem kan worden gelezen als een poging om verspilling in het gesprek tussen een coding agent en zijn omgeving te verminderen. In plaats van van het onderliggende model te vragen dat het op zichzelf goedkoper of beknopter wordt, beperkt, comprimeert of herordent SoL-Pi via de harness wat het model ziet en doet. De claim van de auteurs is daarom niet alleen dat Pi goedkoper kan zijn op een benchmark, maar dat een deel van de efficiëntie kan worden gewonnen zonder de agent opnieuw te trainen of te vervangen.
Vier mechanismen rond Pi
Action Fusion is een van de vier mechanismen die door het auto-onderzoeksproces zijn geselecteerd. Op basis van de naam en de plaats in de harness-stack is de rol ervan het verminderen van inefficiënte actiepatronen door bewerkingen te combineren of te stroomlijnen die anders afzonderlijk zouden worden afgehandeld. Het geverifieerde materiaal geeft geen implementatiedetail buiten de identificatie als een van de overgebleven mechanismen, dus de precieze interne regels moeten niet verder worden afgeleid.
Online Context Compact richt zich op de context die tijdens de run van de agent wordt meegenomen. Coding agents verzamelen vaak informatie terwijl ze bestanden inspecteren, commando’s uitvoeren, output observeren en plannen herzien. De genoemde plaats van het mechanisme in SoL-Pi geeft aan dat het context tijdens de run compacteert, met als doel het tokenverkeer te verlagen en tegelijk genoeg informatie te behouden zodat de agent taken kan blijven oplossen.
ObservationPack is een ander mechanisme aan de harnesszijde. De naam wijst op aandacht voor de manier waarop observaties uit de omgeving worden verpakt voordat ze de agent bereiken. In een lus van een coding agent kunnen ruwe observaties uitvoerig, herhaald of slecht gestructureerd zijn voor de volgende modelaanroep. Het mechanisme maakt deel uit van de door de auteurs gerapporteerde stack om tokenverkeer te verminderen, al ondersteunt de briefing geen specifiekere beschrijving van de gekozen opmaak.
De Evidence-Preserving Reducer is het vierde overgebleven mechanisme. De naam benadrukt een centrale afweging bij compressie voor agentische systemen: het verkorten van tekst kan informatie verwijderen die later toch nodig blijkt. Door bewijs te behouden wordt de reducer gepositioneerd als bescherming tegen het wegcomprimeren van de basis voor beslissingen. Het door de auteurs gemelde meetresultaat is dat de volledige stack ongeveer 94% van Pi’s gemiddelde EdgeBench-score behoudt terwijl tokenverkeer en kosten dalen.
Wat de benchmarkcijfers laten zien
Op EdgeBench is het belangrijkste door de auteurs gerapporteerde resultaat een daling van het tokenverkeer met 44,7% tot 49,0% voor de volledige SoL-Pi-stack. Dezelfde evaluatie meldt ongeveer 33% lagere API-kosten. Omdat API-kosten samenhangen met modelaanroepen en tokengebruik, is het resultaat in lijn met het doel van het systeem: de hoeveelheid tekst en interactie-overhead die door de agentlus gaat verminderen, terwijl een groot deel van de benchmarkscore behouden blijft.
Ook het cijfer voor behouden prestaties is belangrijk. De auteurs melden dat SoL-Pi ongeveer 94% van Pi’s gemiddelde score op de EdgeBench-evaluatie met 51 taken behoudt. Dat is niet hetzelfde als zeggen dat de prestaties onveranderd zijn, en het is geen onafhankelijke validatie. Het betekent dat onder de door de auteurs gerapporteerde omstandigheden de reducties aan de harnesszijde gepaard gingen met een gemeten scoreverlies ten opzichte van Pi, terwijl het grootste deel van de gemiddelde score behouden bleef.
Terminal-Bench 4 biedt een tweede gerapporteerd datapunt met een andere vorm. Daar loste SoL-Pi 15 taken op, tegenover 18 voor Pi, terwijl de totale kosten met 26,3% daalden. Dit resultaat toont de afweging duidelijker: minder opgeloste taken in ruil voor lagere totale kosten. Het waarschuwt er ook voor om de kostenreductie op EdgeBench te lezen als een universele gratis winst over benchmarks heen.
Cross-modeloverdracht wordt als voorlopig beschreven. Dat beperkt de algemeenheid van de claim. Een harnessmethode die goed werkt met één agent en één geteste release hoeft niet noodzakelijk dezelfde balans tussen efficiëntie en prestaties mee te nemen naar andere combinaties van modellen en agents. De geverifieerde feiten ondersteunen de stelling dat SoL-Pi werkt met een ongewijzigde Pi-release en is getest met Pi 0.85.1, maar ze tonen geen brede overdracht over coding-agentsystemen aan.
Praktische implicaties en grenzen
De praktische implicatie is dat exploitanten van coding agents nog een plek hebben om naar efficiëntie te zoeken: de omgevingsharness. Als herhaalde observaties, uitvoerige context en inefficiënte actiepatronen belangrijke kostendrijvers zijn, kan een wrapper het gebruik verminderen zonder de agentrelease zelf te wijzigen. De MIT-licentie van SoL-Pi en de compatibiliteit met een ongewijzigde Pi zijn hier relevant omdat ze de aanpak tot een afzonderlijke extensie maken, niet tot een gevorkt agentontwerp.
Tegelijk wordt het bewijs begrensd door de gerapporteerde benchmarks. De EdgeBench-cijfers zijn door de auteurs gemelde resultaten op 51 taken. De cijfers voor Terminal-Bench 4 zijn eveneens door de auteurs gerapporteerd en tonen een lager aantal opgeloste taken dan Pi. Het auto-onderzoeksproces was uitgebreid volgens de verstrekte aantallen, maar vervangt geen onafhankelijke replicatie. De cijfers demonstreren een gerapporteerde afweging tussen efficiëntie en prestaties onder specifieke tests; ze bewijzen niet dat alle workloads voor coding agents dezelfde kostenreductie of dezelfde behouden score zullen zien.
Het bredere punt is methodologisch. SoL-Pi herformuleert een deel van de optimalisatie van coding agents als harness-engineering: acties controleren, context compact maken, observaties verpakken en bewijs reduceren zonder informatie weg te gooien die nodig is om te handelen. De gerapporteerde daling van API-kosten met ongeveer een derde op EdgeBench is de uitkomst die opvalt, maar de meer duurzame vraag is of zulke mechanismen aan de harnesszijde consistent kunnen worden gemeten over agents, modellen en taken, zonder faalmodi achter compressie te verbergen.
Bronnen
- NVIDIA introduces SoL-PiMarkTechPost · 21 september 2026
- SoL-Pi: Self-Optimizing Language-Agent HarnessesarXiv · 21 september 2026



