Meta让80亿参数模型性能追平Claude Opus 4.5
Meta AI与美国伊利诺伊大学厄巴纳-香槟分校的研究人员使用新的强化学习方法EvoHarness-RL训练开源模型Qwen3-8B。在评估多步骤连续任务的基准测试ALFWorld中,该模型达到96.9%的成功率,超过Claude Opus 4.5的96.4%,比基础ReAct方法提升49个百分点。

Meta AI与美国伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究人员公布了一种基于强化学习的智能体训练方法——EvoHarness-RL。据AI Times于8月29日发布的报道,研究团队将该方法应用于仅有80亿参数的开源模型Qwen3-8B,在评估连续多步骤家务任务的基准测试ALFWorld中取得96.9%的成功率。这一结果超过了Anthropic旗舰模型Claude Opus 4.5使用基础ReAct方法所取得的96.4%,也比Qwen3-8B自身的ReAct基线成绩(47.9%)提升了49.0个百分点。美国媒体VentureBeat于8月28日单独报道了同一项研究,指出在不进行重新训练、仅在推理阶段应用该方法的情况下,OpenAI的GPT-4.1和GPT-5的成绩也分别提升了22.1和25.7个百分点。
BPE:将智能体的状态拆分为信念、进度与经验
EvoHarness-RL的核心是研究人员称为BPE(Belief-Progress-Experience,信念-进度-经验)的状态抽象。信念代表智能体当前对环境的认知;进度记录已完成的子目标与剩余工作;经验则存储从以往任务中积累的技能、失败案例与检索优先级。为管理这三种状态,智能体仅使用四种元动作:追踪(检查当前状态)、提交(记录进度)、回忆(检索过往经验)和记录(写入新信息)。研究人员表示,以往的外部记忆与工具使用系统遵循的是人类预先设定的固定规则,而BPE则训练智能体自主判断何时该记录信息、何时该调取过往经验。
两阶段训练:先监督微调,后强化学习
训练分为两个阶段。第一阶段为监督微调(SFT),Qwen3-8B先学习BPE的含义以及四种元动作的使用方法。第二阶段为强化学习,团队采用所谓的“成本感知的分组相对策略优化”(cost-aware GRPO),训练模型自主判断调用harness这一行为是否真正有助于完成任务。据VentureBeat报道,论文合著者宁绪莹(Xuying Ning)表示,“最优的harness往往因模型而异”,且“仅做追加的记忆机制默认更多上下文总是有帮助,但这一假设并不一定成立”。当研究人员在消融实验中移除经验(Experience)这一组件后,平均成功率降至48.6%,是三个组件中降幅最大的一项。
- 基础ReAct:47.9%
- 仅在推理阶段应用BPE(不重新训练):56.4%
- 加入监督微调(SFT):68.6%
- SFT加强化学习(EvoHarness-RL,最终结果):96.9%
- Claude Opus 4.5——基础ReAct为96.4%,加入BPE后为98.5%(+2.1个百分点)
- GPT-4.1——从47.9%提升到70.0%(推理阶段应用BPE,+22.1个百分点)
- GPT-5——从60.7%提升到85.0%(推理阶段应用BPE,+25.7个百分点)
- 对比系统——SkillRL 89.9%,SkillOS 80.2%
在陌生环境中依然有效,并出现“harness退火”现象
研究人员还在训练中从未出现过的全新ALFWorld任务上测试了该模型。基础版Qwen3-8B仅达到50.0%;仅在推理阶段加入BPE后提升至77.6%;而完整训练后的EvoHarness-RL模型则达到86.6%。在训练过程中,研究人员还观察到一种被称为“harness退火”(harness annealing)的现象:训练初期,智能体几乎在每一步都会调用外部harness,但随着训练推进,重复出现的任务模式被逐渐内化,harness调用频率大幅下降,最终稳定在平均每个任务约调用一次的水平。经验存储库的演化过程也类似:初期迅速积累各类技能与错误案例,随后逐步整合冗余信息、剔除利用率低的技能,最终只保留核心信息,而非无限堆积。研究人员举例说明,一个寻找水壶的智能体发现,自己此前记录的台面位置信息与当前环境不符,于是通过写入新的记录来自我纠正,标注“此前信息有误”。
从软件开发到金融合规
研究人员认为,这一架构的适用范围不止于游戏环境,也可用于真实工作场景。在软件开发中,信念对应代码库及其组件的当前状态,进度对应已完成的任务、测试与依赖项,经验则对应过去的修复方法与错误案例。在金融与合规领域,信念对应适用的法规与证据材料,进度对应已完成的检查与尚未解决的例外情况,经验则对应反复出现的问题及其历史处理方式。团队表示,借助所谓的“环境适配器”,各机构可以保留自身原有的内部工具与状态管理方式,同时加入BPE作为一个可学习的协调层,而无需替换现有的工具或框架。这项研究已发布在预印本平台arXiv上(编号arXiv:2608.05446v1)。
这一结果对正在开发AI智能体的企业具有直接意义。此前,要可靠地处理复杂的多步骤智能体任务,几乎只能依赖Anthropic或OpenAI等厂商价格高昂的前沿模型API。如今,一个80亿参数级别的开源模型只要在记忆与工具调用架构上精心设计,就能达到与前沿模型相当的性能,这意味着更多团队有机会在自有服务器上部署小型模型来构建智能体服务,而不必事事都依赖昂贵的第三方API。不过,这一结果目前仅来自ALFWorld这一单一基准测试的特定条件,要真正应用于实际生产环境,仍需进一步验证。
信息来源
- 메타, 80억 소형 AI로 '클로드 오퍼스 4.5'급 성능 구현…'에보하네스-RL' 공개AI타임스 · 2026年8月29日
- Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tagVentureBeat · 2026年8月28日



