Meta推出Muse Spark 1.3,聚焦更自主的AI代理人
Meta更新其面向代理人(agentic)與程式設計任務的模型:長指令執行更精準,單一任務成本低於競爭對手,據Artificial Analysis指出已在一項銀行業基準測試中排名第一。

Meta宣布推出Muse Spark 1.3,這是該公司針對代理人(agentic)任務與程式設計任務所推出的AI模型新版本。此模型已可透過Muse Code,以及讓外部開發者使用該公司模型的介面Meta Model API取得。根據Meta的說法,這個版本的設計目的是為了更妥善處理需要多個步驟的長任務:面對一個開放式目標時,模型會運用工具蒐集資訊,找出自身規劃中的漏洞,並持續記錄過程中發現的內容。
模型如何處理自己不知道的事
當指令模糊不清時,Muse Spark 1.3可以暫停工作、要求釐清,而不是憑猜測繼續進行。面對自己無法獨力克服的障礙時,它可以請求協助;在執行後果重大的動作前,它會向使用者請求確認。使用者也可以選擇接收關於任務進度的頻繁更新,或是讓系統在背景中持續運作直到完成。
Meta強調的進步之處
該公司列出相較前一版本的多項改進:在遵循長指令方面更加精準,在整個任務過程中更能保持需求與限制條件,在同一段對話中處理多項請求的能力提升,對自身知道與不知道的內容有更清楚的認知,以及編造結果的傾向降低。在程式設計任務上,Meta表示模型現在更精簡、更有效率。
- 在內部比較測試中,工具呼叫次數比Muse Spark 1.2減少約20%
- 在同一項比較中消耗的token數量減少約25%
- 最高推理模式(「max」)要在完成額外的安全測試後才會開放,Meta並未提供確切時程
五個月內該系列的第四款模型
根據德國媒體The Decoder的報導——該媒體將這些數字與Artificial Analysis的基準測試相互比對——Muse Spark 1.3是這個系列在五個月內推出的第四款模型:該系列於4月首度亮相,7月推出1.1版,8月推出1.2版。新版本分為兩個等級:僅供合作夥伴使用的有限預覽版「max」,以及已全面開放的「xhigh」。在Artificial Analysis的Intelligence Index評分中,max等級得62分,xhigh得61分,高於8月的57分與7月的53分。
代理人基準測試出現哪些變化
在τ³-Bench Banking測試中——該測試評估代理人在模擬銀行情境中操作工具的能力——max等級達到52%,目前在Artificial Analysis排行榜上位居第一;xhigh達到47%,與Anthropic的Claude Fable 5.1(max)以及GLM-5.3-Flash並列。前一版本1.2在同一測試中僅得35%。在專注於終端機程式設計的Terminal-Bench 2.1測試中,xhigh從80%升至85%,max達到86%——仍落後於以max等級91.4%領先排行榜的Claude Fable 5.1。
在GDPval-AA v2測試中——該測試以校準自人類表現的Elo量表評估220項真實專業任務——Meta的分數在各版本間從1615分升至1709分,再升至1754分。Claude Fable 5.1(max)以1853分持續領先;為縮小這項差距,Muse Spark的max版本比xhigh多消耗62%的推理token。在面向專家級科學問題的GPQA Diamond測試中,Muse Spark從90%升至94%——躋身第一梯隊,但仍落後於Gemini 3.8 Flash(high,95.3%)與Grok 4.6(high,94.9%)。在研究型物理測試CritPt中,成績從18%提升至26%,領先位置仍由GPT-5.6 Sol(max,32.3%)與Claude Fable 5.1(xhigh,31.1%)所占據。
並非所有指標都有進步:與1.2版本相比,AA-LCR從83%降至79%,AA-Omniscience上的事實準確率也下滑最多三個百分點,原因是模型在不確定時更常拒絕回答。
價格不變,安全性提升
定價方面,Meta維持每百萬輸入token 1.25美元、每百萬輸出token 4.25美元——與前一版本相同。Intelligence Index一項任務的平均成本為0.55美元,是該指數得分59分以上的模型中最低的;競爭對手完成同一任務的收費介於0.94美元至1.23美元之間。儘管如此,Muse Spark 1.3仍比每任務0.40美元的1.2版本更貴——max版本的價格尚未公布。該公司也表示未來將推出更大型的模型,以及日後的開放權重(open-weights)版本。
在安全性方面,Meta表示Muse Spark 1.3對對抗性輸入與提示注入(prompt injection)攻擊的抵禦能力有所提升,並能在執行動作前更準確評估該動作是否不可逆。因此,最高推理模式要在完成額外安全測試後才會開放,Meta並未公布時程。
對於在代理人式程式設計領域,必須在Meta較為開放的生態系與Anthropic、Google等封閉模型之間做選擇的台灣開發者與新創公司而言,Muse Spark 1.3從兩方面改變了這道算式。首先,在頂尖模型中屬於最低區間的單一任務成本,降低了長時間運作的代理人所需的花費——對於本就需要謹慎評估以美元計價之API開銷的台灣團隊而言,這是實際的助益。其次,Meta預告的未來開放權重版本,強化了台灣企業一直關注的一條路徑:在自有基礎設施上運行模型,而非完全仰賴海外的封閉API。與在多數上述基準測試中仍然領先的Claude Fable 5.1之間的差距並未消失,但已縮小到讓這項選擇不再理所當然的程度。
資料來源
- Meta lança Muse Spark 1.3 com foco em agentes mais autônomosOlhar Digital · 2026年9月3日
- Meta schließt mit Muse Spark 1.3 zur Spitze auf, lockt mit niedrigen PreisenThe Decoder · 2026年9月2日



