SoL-Pi 将编码智能体效率优化移入运行框架
NVIDIA、NTU 和 MIT 研究人员称,SoL-Pi 在不修改底层 Pi 编码智能体的情况下,在 EdgeBench 上减少了 token 流量和 API 成本。

SoL-Pi 是面向开源 Pi 编码智能体的新效率层,由 NVIDIA、NTU 和 MIT 的研究人员于 9 月 21 日发布。它的主要变化在架构层面:不是改变模型,也不是改变 Pi 智能体本身,而是改变围绕智能体运行的 harness。作者报告称,在包含 51 项任务的 EdgeBench 评测中,完整 SoL-Pi 栈将 token 流量降低 44.7% 至 49.0%,将 API 成本降低约 33%,同时保留 Pi 平均分约 94% 的水平。
从模型改动到 harness 改动
这项工作针对的是编码智能体常见的压力点:它们与环境的反复交互会产生很长的历史记录、重复的观察结果,以及成本较高的模型调用。SoL-Pi 并未声称引入新的编码模型。它被描述为一个采用 MIT 许可证的扩展,可与未修改的 Pi 版本配合使用。报告中的测试使用了 Pi 0.85.1,以及 Node.js 22.19 或更高版本。
这一区分很重要,因为编码智能体的效率优化可以发生在多个层级。模型提供商可以改变模型。智能体开发者可以调整智能体的规划或工具使用逻辑。基准测试运营者可以在固定环境中衡量端到端性能。SoL-Pi 位于围绕智能体的第二层,但报告中的数字仍然是作者报告的基准测试结果,并非独立测量。
研究人员使用 AI 自动研究流程来搜索效率机制。根据论文,该流程探索了六大类中的 152 个方向、535 个可执行环境、超过 3,000 次运行,以及超过 60,000 次智能体与环境交互。从这次搜索中,四种机制保留下来:Action Fusion、Online Context Compact、ObservationPack,以及 Evidence-Preserving Reducer。
由此形成的系统可以被理解为一种减少编码智能体与其环境之间对话浪费的尝试。SoL-Pi 不是要求底层模型自行变得更便宜或更简洁,而是通过 harness 限制、压缩或重组模型所看到的内容和所执行的操作。因此,作者的主张不仅是 Pi 可以在某个基准上成本更低,也包括某些效率可以在不重新训练或替换智能体的情况下被提取出来。
围绕 Pi 的四种机制
Action Fusion 是自动研究流程选出的四种机制之一。根据其名称及其在 harness 栈中的位置,它的作用是通过合并或简化原本会被分开处理的操作,减少低效的动作模式。已核实材料除将其列为保留下来的机制之一外,没有提供实现细节,因此不应在此基础上推断其更精确的内部规则。
Online Context Compact 处理的是智能体运行过程中携带的上下文。编码智能体在检查文件、运行命令、观察输出并修订计划时,往往会积累信息。该机制在 SoL-Pi 中的既定位置表明,它会在运行期间压缩上下文,目标是在降低 token 流量的同时,保留足够信息,使智能体能够继续解决任务。
ObservationPack 是另一种位于 harness 侧的机制。它的名称表明,重点在于环境观察结果在到达智能体之前如何被打包。在编码智能体循环中,原始观察结果可能冗长、重复,或对下一次模型调用而言结构不佳。该机制属于作者报告的、用于减少 token 流量的栈的一部分,不过现有简报不足以支持对其格式选择作出更具体描述。
Evidence-Preserving Reducer 是第四种保留下来的机制。它的名称突出了智能体系统压缩中的一个核心权衡:减少文本可能会删除后来证明必要的信息。通过保留证据,该 reducer 被定位为一种防护措施,避免把决策所依据的信息压缩掉。作者报告的测量结果是,完整栈在降低 token 流量和成本的同时,保留了 Pi 在 EdgeBench 平均分约 94% 的水平。
基准数字显示了什么
在 EdgeBench 上,作者报告的主要结果是,完整 SoL-Pi 栈将 token 流量降低 44.7% 至 49.0%。同一评测还报告 API 成本降低约 33%。由于 API 成本与模型调用和 token 使用相关,这一结果与系统目标一致:减少通过智能体循环发送的文本量和交互开销,同时保留基准分数中的很大一部分。
保留性能的数字同样重要。作者报告称,在 51 项任务的 EdgeBench 评测中,SoL-Pi 保持了 Pi 平均分约 94% 的水平。这并不等同于性能没有变化,也不是独立验证。它意味着,在作者报告的条件下,harness 侧的削减相对于 Pi 伴随可测得的分数损失,但仍保留了大部分平均分。
Terminal-Bench 4 给出了形态不同的第二个报告数据点。在该测试中,SoL-Pi 解决了 15 项任务,而 Pi 解决了 18 项任务,同时将总成本降低 26.3%。这一结果更直观地显示了权衡:以更少的已解决任务换取更低的总成本。它也提示,不应把 EdgeBench 上的成本降低解读为跨基准测试普遍存在的无代价收益。
跨模型迁移被描述为初步结果。这限制了该主张的普遍性。一种 harness 方法即便在一个智能体和一个已测试版本上运行良好,也未必能把相同的效率与性能平衡带到其他模型和智能体组合上。已核实事实支持这样的表述:SoL-Pi 可与未修改的 Pi 版本配合使用,并已使用 Pi 0.85.1 测试;但这些事实并未确立其在编码智能体系统之间的广泛迁移能力。
实际含义与边界
实际含义是,编码智能体运营者或许可以在另一个位置寻找效率:环境 harness。如果重复观察、冗长上下文和低效动作模式是主要成本驱动因素,那么一个包装层可以在不改变智能体版本本身的情况下减少用量。SoL-Pi 的 MIT 许可证以及与未修改 Pi 的兼容性在这里相关,因为这使其成为一个可分离的扩展,而不是一个分叉出来的智能体设计。
与此同时,证据范围受限于已报告的基准测试。EdgeBench 数字是作者在 51 项任务上的报告结果。Terminal-Bench 4 数字同样由作者报告,并显示其已解决任务数量低于 Pi。自动研究流程在所提供数字上规模较大,但它不能取代独立复现。这些数字展示的是在特定测试下报告的效率与性能权衡;它们并不证明所有编码智能体工作负载都会得到相同的成本降低或相同的分数保留。
更广泛的重点在方法论。SoL-Pi 将编码智能体优化的一部分重新表述为 harness 工程:控制动作、压缩上下文、打包观察结果,并在不丢弃行动所需信息的情况下减少证据。EdgeBench 上报告的 API 成本降低约三分之一是主要结果,但更持久的问题是,这类 harness 侧机制能否在智能体、模型和任务之间被一致测量,同时不让压缩掩盖失败模式。
信息来源
- NVIDIA introduces SoL-PiMarkTechPost · 2026年9月21日
- SoL-Pi: Self-Optimizing Language-Agent HarnessesarXiv · 2026年9月21日



