SoL-Pi、コーディングエージェントの効率化をハーネス側へ移す
NVIDIA、NTU、MITの研究者は、SoL-Piが基盤エージェントを変更せず、EdgeBenchでPiのトークン通信量とAPIコストを削減したと報告した。

SoL-Piは、NVIDIA、NTU、MITの研究者が9月21日に公開した、オープンソースのPiコーディングエージェント向けの新しい効率化レイヤーだ。主な変更点はアーキテクチャにある。モデルやPiエージェント本体を変更するのではなく、エージェントを取り巻くハーネスを変更する。著者らは、51タスクからなるEdgeBench評価で、SoL-Piのフルスタックがトークン通信量を44.7%から49.0%削減し、APIコストを約33%下げた一方で、Piの平均スコアの約94%を維持したと報告している。
モデル変更からハーネス変更へ
この研究が対象にするのは、コーディングエージェントでよく見られる負荷のかかる部分だ。環境との反復的なやり取りは、長い履歴、繰り返しの観測、コストの高いモデル呼び出しを生みやすい。SoL-Piは新しいコーディングモデルを導入すると主張していない。未変更のPiリリースで動作する、MITライセンスの拡張として説明されている。報告されたテストでは、Pi 0.85.1とNode.js 22.19以降が使われた。この区別は重要だ。コーディングエージェントの効率化は複数の階層で起こり得る。モデル提供者はモデルを変更できる。エージェント開発者は計画立案やツール利用のロジックを変えられる。ベンチマーク運用者は固定された環境でエンドツーエンド性能を測定できる。SoL-Piはエージェント周辺の第2の層に位置するが、報告された数値は著者によるベンチマーク結果であり、独立した測定ではない。
研究者らは、効率化メカニズムを探すためにAIによる自動研究プロセスを使った。論文によれば、そのプロセスは6つのファミリーにまたがる152の方向性、535の実行可能環境、3,000回超の実行、60,000回超のエージェント・環境間インタラクションを探索した。その探索から残ったメカニズムは4つで、Action Fusion、Online Context Compact、ObservationPack、Evidence-Preserving Reducerである。最終的なシステムは、コーディングエージェントと環境の会話に含まれる無駄を減らす試みと読める。基盤モデル自体に、より安価またはより簡潔になることを求めるのではなく、SoL-Piはハーネスを通じて、モデルが見るものや実行することを制約、圧縮、再編成する。したがって著者らの主張は、Piがベンチマーク上で安くなるというだけではなく、エージェントを再訓練したり置き換えたりせずに一部の効率化を引き出せるという点にある。
Piを取り巻く4つのメカニズム
Action Fusionは、自動研究プロセスで選ばれた4つのメカニズムの1つだ。名称とハーネススタック内での位置づけに基づけば、その役割は、本来なら個別に処理される操作を組み合わせる、または簡素化することで、非効率なアクションパターンを減らすことにある。確認できる資料は、これを残存したメカニズムの1つとして特定する以上の実装詳細を示していないため、正確な内部規則をそれ以上推測すべきではない。
Online Context Compactは、エージェントの実行中に保持されるコンテキストを扱う。コーディングエージェントは、ファイルを調べ、コマンドを実行し、出力を観測し、計画を修正する過程で情報を蓄積しがちだ。SoL-Piにおけるこのメカニズムの位置づけは、実行中にコンテキストをコンパクト化し、タスク解決を続けるために十分な情報を残しながら、トークン通信量を下げることを狙うものだと示している。
ObservationPackもハーネス側のメカニズムである。その名称は、環境からの観測がエージェントに届く前にどのようにパッケージ化されるかに注意を向けている。コーディングエージェントのループでは、生の観測は冗長だったり、繰り返しを含んでいたり、次のモデル呼び出しにとって構造化が不十分だったりすることがある。このメカニズムは、著者らが報告したトークン通信量削減スタックの一部だが、提示された情報からは、形式化の選択についてこれ以上具体的に説明することはできない。
Evidence-Preserving Reducerは、残った4つ目のメカニズムだ。その名称は、エージェント型システムにおける圧縮の中心的なトレードオフを示している。つまり、テキストを減らすと、後で必要になる情報が取り除かれる可能性がある。証拠を保持することで、このリデューサーは、意思決定の根拠を圧縮で失わないための安全策として位置づけられる。著者らが報告した測定結果では、フルスタックはPiのEdgeBench平均スコアの約94%を維持しながら、トークン通信量とコストを削減した。
ベンチマーク数値が示すもの
EdgeBenchで著者らが報告した主な結果は、SoL-Piのフルスタックによるトークン通信量の44.7%から49.0%の削減である。同じ評価では、APIコストが約33%低下したとも報告されている。APIコストはモデル呼び出しとトークン使用量に結びつくため、この結果は、エージェントループを通じて送られるテキスト量とインタラクション上のオーバーヘッドを減らしつつ、ベンチマークスコアの多くを維持するというシステムの目的と整合している。
維持された性能の数値も重要だ。著者らは、SoL-Piが51タスクのEdgeBench評価でPiの平均スコアの約94%を保ったと報告している。これは性能が変わらなかったと言うこととは同じではなく、独立した検証でもない。著者らが報告した条件下で、ハーネス側の削減にはPiに対する測定上のスコア低下が伴ったが、それでも平均スコアの大部分を維持した、という意味である。
Terminal-Bench 4は、異なる形の2つ目の報告データ点を与えている。そこでは、SoL-Piが解いたタスクは15件で、Piの18件に対し少なかった一方、総コストは26.3%削減された。この結果は、トレードオフをより明確に示している。つまり、総コストを下げる代わりに、解けたタスク数が減っている。これはまた、EdgeBenchでのコスト削減を、ベンチマーク全体にまたがる普遍的な無償の改善として読むべきではないことも示している。
モデルをまたいだ移転については、予備的なものと説明されている。これにより主張の一般性は限定される。あるエージェントと、テストされた1つのリリースでうまく機能するハーネス手法が、ほかのモデルとエージェントの組み合わせに同じ効率・性能のバランスをもたらすとは限らない。確認された事実は、SoL-Piが未変更のPiリリースで動作し、Pi 0.85.1でテストされたという記述を支持するが、コーディングエージェントシステム全般への広い移転を立証するものではない。
実務上の含意と限界
実務上の含意は、コーディングエージェントの運用者が効率化を検討する別の場所として、環境ハーネスを見られる可能性があるという点だ。繰り返しの観測、冗長なコンテキスト、非効率なアクションパターンが主要なコスト要因であるなら、ラッパーはエージェントリリース自体を変更せずに使用量を減らせる。SoL-PiのMITライセンスと未変更Piとの互換性は、この点で関連がある。フォークされたエージェント設計ではなく、分離可能な拡張としてこの手法を位置づけるためだ。同時に、証拠は報告されたベンチマークに限定される。EdgeBenchの数値は51タスクに関する著者報告の結果であり、Terminal-Bench 4の数値も著者報告で、Piより少ない解決タスク数を示している。自動研究プロセスは提示された数字の範囲では大規模だが、独立した再現に代わるものではない。
より広い論点は方法論にある。SoL-Piは、コーディングエージェント最適化の一部をハーネス工学として捉え直している。すなわち、アクションを制御し、コンテキストをコンパクト化し、観測をパッケージ化し、行動に必要な情報を捨てずに証拠を削減するということだ。EdgeBenchでAPIコストが約3分の1低下したという報告が見出しとなる結果だが、より持続的な問いは、こうしたハーネス側メカニズムが、圧縮の背後に失敗モードを隠すことなく、エージェント、モデル、タスクをまたいで一貫して測定できるかどうかである。
出典
- NVIDIA introduces SoL-PiMarkTechPost · 2026年9月21日
- SoL-Pi: Self-Optimizing Language-Agent HarnessesarXiv · 2026年9月21日



