SoL-Pi verlagert Effizienz für Coding-Agenten in die Harness-Schicht
Forschende von NVIDIA, NTU und MIT berichten, dass SoL-Pi auf EdgeBench Tokenverkehr und API-Kosten des Pi-Coding-Agenten senkt, ohne den Agenten selbst zu ändern.

SoL-Pi ist eine neue Effizienzschicht für den quelloffenen Pi-Coding-Agenten, veröffentlicht von Forschenden von NVIDIA, NTU und MIT am 21. September. Die wichtigste Veränderung ist architektonisch: Statt das Modell oder den Pi-Agenten selbst zu verändern, ändert SoL-Pi die Harness-Schicht um den Agenten. Die Autoren berichten, dass der vollständige SoL-Pi-Stack in der EdgeBench-Evaluierung mit 51 Aufgaben den Tokenverkehr um 44,7 % bis 49,0 % reduziert und die API-Kosten um etwa 33 % senkt, während etwa 94 % des durchschnittlichen Pi-Scores erhalten bleiben.
Von Modelländerungen zu Harness-Änderungen
Die Arbeit zielt auf einen bekannten Druckpunkt bei Coding-Agenten: Ihre wiederholte Interaktion mit Umgebungen kann lange Verläufe, wiederholte Beobachtungen und kostspielige Modellaufrufe erzeugen. SoL-Pi beansprucht nicht, ein neues Coding-Modell einzuführen. Es wird als MIT-lizenzierte Erweiterung beschrieben, die mit einer unveränderten Pi-Version arbeitet. Die berichteten Tests verwendeten Pi 0.85.1 und Node.js 22.19 oder neuer.
Diese Unterscheidung ist wichtig, weil Effizienzarbeit bei Coding-Agenten auf mehreren Ebenen stattfinden kann. Ein Modellanbieter kann das Modell ändern. Ein Agentenentwickler kann die Planungs- oder Tool-Nutzungslogik des Agenten anpassen. Ein Benchmark-Betreiber kann die Ende-zu-Ende-Leistung in einer festen Umgebung messen. SoL-Pi liegt in der zweiten Schicht um den Agenten, aber die berichteten Zahlen bleiben von den Autoren gemeldete Benchmark-Ergebnisse, keine unabhängigen Messungen.
Die Forschenden nutzten einen KI-gestützten Auto-Research-Prozess, um nach Effizienzmechanismen zu suchen. Laut Paper untersuchte dieser Prozess 152 Richtungen in sechs Familien, 535 ausführbare Umgebungen, mehr als 3.000 Läufe und über 60.000 Interaktionen zwischen Agent und Umgebung. Aus dieser Suche blieben vier Mechanismen übrig: Action Fusion, Online Context Compact, ObservationPack und ein Evidence-Preserving Reducer.
Das daraus entstandene System lässt sich als Versuch lesen, Verschwendung in der Konversation zwischen einem Coding-Agenten und seiner Umgebung zu reduzieren. Anstatt vom zugrunde liegenden Modell zu verlangen, von sich aus günstiger oder knapper zu werden, begrenzt, komprimiert oder reorganisiert SoL-Pi über die Harness-Schicht, was das Modell sieht und tut. Die Aussage der Autoren lautet daher nicht nur, dass Pi auf einem Benchmark günstiger werden kann, sondern dass sich ein Teil der Effizienz ohne erneutes Training oder Austausch des Agenten gewinnen lässt.
Vier Mechanismen um Pi
Action Fusion ist einer der vier Mechanismen, die durch den Auto-Research-Prozess ausgewählt wurden. Aus Name und Platzierung im Harness-Stack ergibt sich die Rolle, ineffiziente Aktionsmuster zu reduzieren, indem Operationen kombiniert oder gestrafft werden, die sonst getrennt behandelt würden. Das verifizierte Material liefert keine Implementierungsdetails über die Identifikation als einer der verbliebenen Mechanismen hinaus; genaue interne Regeln sollten daher nicht darüber hinaus abgeleitet werden.
Online Context Compact befasst sich mit dem Kontext, der durch den Lauf des Agenten getragen wird. Coding-Agenten sammeln häufig Informationen an, während sie Dateien inspizieren, Befehle ausführen, Ausgaben beobachten und Pläne überarbeiten. Die angegebene Position des Mechanismus in SoL-Pi zeigt, dass er Kontext während des Laufs kompaktiert, mit dem Ziel, den Tokenverkehr zu senken und zugleich genug Informationen zu bewahren, damit der Agent Aufgaben weiter lösen kann.
ObservationPack ist ein weiterer Mechanismus auf Harness-Seite. Der Name verweist auf die Frage, wie Beobachtungen aus der Umgebung verpackt werden, bevor sie den Agenten erreichen. In einer Coding-Agenten-Schleife können rohe Beobachtungen ausführlich, wiederholt oder für den nächsten Modellaufruf ungünstig strukturiert sein. Der Mechanismus ist Teil des von den Autoren berichteten Stacks zur Verringerung des Tokenverkehrs, auch wenn die vorliegenden Angaben keine spezifischere Beschreibung seiner Formatierungsentscheidungen stützen.
Der Evidence-Preserving Reducer ist der vierte verbliebene Mechanismus. Sein Name hebt einen zentralen Zielkonflikt bei Kompression in agentischen Systemen hervor: Das Reduzieren von Text kann Informationen entfernen, die sich später als notwendig erweisen. Durch das Bewahren von Evidenz wird der Reducer als Schutz dagegen positioniert, die Grundlage für Entscheidungen wegzukomprimieren. Das von den Autoren berichtete Messergebnis lautet, dass der vollständige Stack etwa 94 % des durchschnittlichen EdgeBench-Scores von Pi erhält, während Tokenverkehr und Kosten sinken.
Was die Benchmark-Zahlen zeigen
Auf EdgeBench ist das wichtigste von den Autoren berichtete Ergebnis eine Verringerung des Tokenverkehrs um 44,7 % bis 49,0 % für den vollständigen SoL-Pi-Stack. Dieselbe Evaluierung meldet etwa 33 % niedrigere API-Kosten. Da API-Kosten mit Modellaufrufen und Token-Nutzung verbunden sind, passt das Ergebnis zum Ziel des Systems: die Menge an Text und Interaktions-Overhead zu verringern, die durch die Agentenschleife geschickt wird, während ein großer Teil des Benchmark-Scores erhalten bleibt.
Auch die erhaltene Leistungskennzahl ist wichtig. Die Autoren berichten, dass SoL-Pi in der EdgeBench-Evaluierung mit 51 Aufgaben etwa 94 % des durchschnittlichen Pi-Scores beibehält. Das ist nicht gleichbedeutend damit, dass die Leistung unverändert bleibt, und es ist keine unabhängige Validierung. Es bedeutet, dass unter den von den Autoren berichteten Bedingungen die Reduktionen auf Harness-Seite mit einem gemessenen Score-Verlust gegenüber Pi einhergingen, während der größte Teil des Durchschnittsscores erhalten blieb.
Terminal-Bench 4 liefert einen zweiten berichteten Datenpunkt mit anderer Ausprägung. Dort löste SoL-Pi 15 Aufgaben, verglichen mit 18 für Pi, während die Gesamtkosten um 26,3 % sanken. Dieses Ergebnis zeigt den Zielkonflikt deutlicher: weniger gelöste Aufgaben im Austausch gegen niedrigere Gesamtkosten. Es mahnt auch dazu, die EdgeBench-Kostenreduktion nicht als universellen kostenlosen Gewinn über Benchmarks hinweg zu lesen.
Der Transfer über Modelle hinweg wird als vorläufig beschrieben. Das begrenzt die Allgemeingültigkeit der Aussage. Eine Harness-Methode, die mit einem Agenten und einer getesteten Version gut funktioniert, muss nicht zwangsläufig dieselbe Effizienz-Leistungs-Balance auf andere Modell- und Agentenkombinationen übertragen. Die verifizierten Fakten stützen die Aussage, dass SoL-Pi mit einer unveränderten Pi-Version arbeitet und mit Pi 0.85.1 getestet wurde; sie belegen aber keinen breiten Transfer über Coding-Agenten-Systeme hinweg.
Praktische Bedeutung und Grenzen
Die praktische Bedeutung besteht darin, dass Betreiber von Coding-Agenten an einer weiteren Stelle nach Effizienz suchen können: in der Umgebungs-Harness. Wenn wiederholte Beobachtungen, ausführlicher Kontext und ineffiziente Aktionsmuster wesentliche Kostentreiber sind, kann ein Wrapper die Nutzung reduzieren, ohne die Agentenversion selbst zu ändern. Die MIT-Lizenz von SoL-Pi und die Kompatibilität mit unverändertem Pi sind hier relevant, weil sie den Ansatz zu einer abtrennbaren Erweiterung machen, nicht zu einem abgespaltenen Agentendesign.
Gleichzeitig ist die Evidenz durch die berichteten Benchmarks begrenzt. Die EdgeBench-Zahlen sind von den Autoren gemeldete Ergebnisse auf 51 Aufgaben. Die Terminal-Bench-4-Zahlen stammen ebenfalls von den Autoren und zeigen eine niedrigere Zahl gelöster Aufgaben als Pi. Der Auto-Research-Prozess war nach den genannten Zahlen umfangreich, ersetzt aber keine unabhängige Replikation. Die Zahlen zeigen einen berichteten Effizienz-Leistungs-Zielkonflikt unter festgelegten Tests; sie beweisen nicht, dass alle Coding-Agenten-Workloads dieselbe Kostenreduktion oder denselben erhaltenen Score sehen werden.
Der breitere Punkt ist methodisch. SoL-Pi formuliert einen Teil der Optimierung von Coding-Agenten als Harness-Engineering neu: Aktionen kontrollieren, Kontext komprimieren, Beobachtungen verpacken und Evidenz reduzieren, ohne die zum Handeln benötigten Informationen zu verwerfen. Die berichteten um ein Drittel niedrigeren API-Kosten auf EdgeBench sind das zentrale Ergebnis, doch die längerfristige Frage ist, ob sich solche Harness-seitigen Mechanismen konsistent über Agenten, Modelle und Aufgaben hinweg messen lassen, ohne Fehlermodi hinter Kompression zu verbergen.
Quellen
- NVIDIA introduces SoL-PiMarkTechPost · 21. September 2026
- SoL-Pi: Self-Optimizing Language-Agent HarnessesarXiv · 21. September 2026



