Meta推出Muse Spark 1.3,聚焦更自主的AI智能体
Meta更新其面向智能体与编程任务的模型:长指令执行更精准,单任务成本低于竞品,据Artificial Analysis称已在一项银行业基准测试中排名第一。

Meta宣布推出Muse Spark 1.3,这是其面向智能体(agentic)任务和编程任务的AI模型的新版本。该模型已可通过Muse Code以及向外部开发者开放公司模型的接口Meta Model API使用。据Meta介绍,这一版本旨在更好地处理需要多个步骤的长任务:面对一个开放式目标时,模型会使用工具收集信息,识别自身规划中的漏洞,并在过程中持续记录所发现的内容。
模型如何处理自己不知道的信息
当指令含糊不清时,Muse Spark 1.3可以中断工作以请求澄清,而不是凭猜测继续推进。遇到自己无法独立克服的障碍时,它可以请求帮助;在执行后果重大的操作之前,它会向用户请求确认。用户还可以选择接收关于任务进度的频繁更新,或者让系统在后台工作直至完成。
Meta重点提及的改进
该公司列出了相较上一版本的多项改进:在遵循长指令方面更加精准,在整个任务过程中更好地保持需求与约束条件,在同一次对话中处理多个请求的能力增强,对自身知道与不知道的内容有更清晰的认知,以及编造结果的倾向减少。在编程任务上,Meta表示模型现在更加简洁高效。
- 在内部对比测试中,工具调用次数比Muse Spark 1.2减少约20%
- 在同一对比中消耗的令牌数量减少约25%
- 最高推理模式('max')要在完成额外的安全测试后才会开放,Meta未给出具体时间
五个月内该系列的第四款模型
据德国媒体The Decoder报道,该媒体将这些数字与Artificial Analysis的基准测试进行了比对,Muse Spark 1.3是该系列五个月内推出的第四款模型:该系列于4月首发,7月推出1.1版,8月推出1.2版。新版本分为两个档位:面向合作伙伴的有限预览版'max',以及已全面开放的'xhigh'。在Artificial Analysis的Intelligence Index评分中,max档位得62分,xhigh得61分,高于8月的57分和7月的53分。
智能体基准测试中发生了哪些变化
在τ³-Bench Banking测试中——该测试评估智能体在模拟银行场景中操作工具的能力——max档位达到52%,目前在Artificial Analysis排行榜上排名第一;xhigh达到47%,与Anthropic的Claude Fable 5.1(max)以及GLM-5.3-Flash并列。上一版本1.2在同一测试中仅为35%。在专注于终端编程的Terminal-Bench 2.1测试中,xhigh从80%升至85%,max达到86%——仍落后于以91.4%(max档位)领先榜单的Claude Fable 5.1。
在GDPval-AA v2测试中——该测试用以人类表现校准的Elo量表评估220项真实职业任务——Meta的分数在各版本间从1615分升至1709分,再升至1754分。Claude Fable 5.1(max)以1853分继续领先;为缩小这一差距,Muse Spark的max版本比xhigh多消耗62%的推理令牌。在面向专家级科学问题的GPQA Diamond测试中,Muse Spark从90%升至94%——跻身第一梯队,但仍落后于Gemini 3.8 Flash(high,95.3%)和Grok 4.6(high,94.9%)。在研究型物理测试CritPt中,成绩从18%提升至26%,领先位置仍由GPT-5.6 Sol(max,32.3%)和Claude Fable 5.1(xhigh,31.1%)占据。
并非所有指标都有所提升:与1.2版本相比,AA-LCR从83%降至79%,AA-Omniscience上的事实准确率也下降了最多三个百分点,原因是模型在不确定时更频繁地拒绝作答。
价格不变,安全性增强
定价方面,Meta维持每百万输入令牌1.25美元、每百万输出令牌4.25美元——与上一版本相同。Intelligence Index上一项任务的平均成本为0.55美元,是该指数得分59分及以上的模型中最低的;竞品完成同一任务收费在0.94美元至1.23美元之间。尽管如此,Muse Spark 1.3仍比每任务0.40美元的1.2版本更贵——max版本的价格尚未公布。该公司还表示将推出更大规模的模型,以及未来的开放权重(open-weights)版本。
在安全性方面,Meta表示Muse Spark 1.3对对抗性输入和提示注入(prompt injection)尝试的抵御能力有所增强,并能在执行操作前更准确地评估该操作是否不可逆。因此,最高推理模式要在完成额外的安全测试后才会开放,Meta未给出具体时间表。
对于在智能体编程领域,需要在Meta更开放的生态系统与Anthropic、谷歌等封闭模型之间做出选择的中国开发者和创业公司而言,Muse Spark 1.3从两方面改变了这道算式。首先,在顶尖模型中处于最低区间的单任务成本,降低了长时间运行的智能体的开销——对本就受限于直接访问境外闭源API、需要谨慎评估每一分成本的团队而言,这是实际的利好。其次,Meta预告的未来开放权重版本,强化了一条中国开发者一直关注的路径:在自有基础设施上运行模型,而不是完全依赖境外的封闭API。与在大多数上述基准测试中仍然领先的Claude Fable 5.1之间的差距并未消失,但已收窄到足以让这一选择不再是理所当然的地步。
信息来源
- Meta lança Muse Spark 1.3 com foco em agentes mais autônomosOlhar Digital · 2026年9月3日
- Meta schließt mit Muse Spark 1.3 zur Spitze auf, lockt mit niedrigen PreisenThe Decoder · 2026年9月2日



