Claude Fable 5.1上線,代理型任務最高省45%
Claude Fable 5.1在Terminal-Bench-Science基準測試中取得52.6%的成績,快取讀取價格調降75%,同時帶來三項不向下相容的API變更,既有Claude用戶需要留意。

Anthropic於9月1日發布Claude Fable 5.1與Claude Mythos 5.1,距離Fable 5系列在2026年6月推出僅三個月。兩款模型其實是同一套底層系統,只是套用了不同的安全防護層:Fable 5.1以claude-fable-5-1這個API名稱對外公開,Mythos 5.1則仍只提供給通過審核的合作機構。Anthropic用三個數字概括這次發布:在針對科學研究任務的Terminal-Bench-Science 0.1基準測試中取得52.6%,是Fable 5的24.7%的兩倍以上;快取讀取價格調降75%,從每百萬個代符1.00美元降至0.25美元;在複雜的代理型工作負載中,最高可省下45%的成本。
Fable 5.1即日起可透過Claude API、Amazon Bedrock、AWS上的Claude、Google Cloud以及Microsoft Foundry使用。相較之下,Mythos 5.1僅開放給加入Project Glasswing的機構,這是Anthropic針對從事網路安全或生命科學研究的合作夥伴設立的審核計畫。兩款模型都配備一百萬代符的上下文視窗、最高12.8萬代符的輸出上限,並且預設開啟自適應推理,沒有獨立開關可以關閉。
基準測試究竟說明了什麼
在圍繞真實科研任務打造的代理型基準測試Terminal-Bench-Science 0.1中,Fable 5.1取得52.6%,領先Anthropic自家的Opus 5(29.0%)、Fable 5(24.7%)以及OpenAI的GPT-5.6 Sol(22.4%)。Anthropic自己也提醒,每個模型的標準誤差落在3.5到4.5個百分點之間,因此名次順序比兩個分數之間的確切差距更值得注意。在針對命令列程式設計任務的Terminal-Bench 4.0中,Fable 5.1取得55.8%,Mythos 5.1則達到60.9%——這是兩個本質相同的模型之間的落差,Anthropic直接將其歸因於安全防護措施的代價,這種坦白在模型廠商中並不常見。
- Terminal-Bench-Science 0.1:Fable 5.1為52.6%,對比Opus 5的29.0%、Fable 5的24.7%、GPT-5.6 Sol的22.4%
- Terminal-Bench 4.0:Fable 5.1為55.8%,Mythos 5.1為60.9%
- Humanity's Last Exam:不使用工具時60.9%,使用工具時65.0%
- CursorBench 3.2.0:73.4%
- AutomationBench 31.4%,OSWorld 2.0(嚴格模式)41.7%
價格為什麼下降
基本價格維持不變:輸入每百萬代符10美元,輸出每百萬代符50美元。這次調降針對的是快取內容:從提示詞快取讀取現在每百萬代符只要0.25美元,而不是1.00美元,相當於基本輸入價格的0.025倍,而其他所有Claude模型的比例都是0.1倍。Anthropic估計,一般工作負載的成本大約會降低25%,而在反覆重複使用大型上下文視窗的代理型任務中,降幅最高可達約45%——這正是長時間程式設計工作階段或多步驟研究型代理的典型使用模式。至於可以容忍延遲的批次處理,價格仍維持在每百萬代符5美元與25美元。
三項不向下相容的API變更,將影響既有整合
Anthropic還記錄了三項不向下相容的API變更,直接針對已經以Claude為基礎打造產品的團隊。強制工具呼叫被取消:將tool_choice設為'any'或指定某個工具,現在會回傳400錯誤,Anthropic建議改用auto模式,並搭配嚴格工具呼叫或結構化輸出。推理區塊現在與模型綁定——Fable 5.1可以讀取先前Claude模型產生的推理區塊,但沒有任何一個先前模型能夠回讀自己的推理內容,這會破壞那些在對話中途悄悄降級為舊模型的路由或備援機制。修改先前的對話輪次現在會讓推理區塊完全失效:在對話中途插入或刪除依輪次而定的提醒訊息,或重建系統提示詞、工具陣列,都會直接觸發錯誤,不再被默默接受。這項檢查適用於2026年8月31日之後建立的帳戶,Anthropic建議的解法是改用限定於單一輪次的系統訊息,以及伺服器端的上下文編輯功能。
- 取消強制工具呼叫:tool_choice設為'any'或'tool'現在會回傳HTTP 400錯誤
- 推理區塊與模型綁定:舊模型無法回讀Fable 5.1產生的推理內容
- 修改先前的對話輪次會出錯:對話中途重建系統提示詞或工具陣列的做法遭到封鎖
Anthropic在公布進步之餘,也列出了確實存在的退步。並行工具呼叫變得較不穩定,導致代理迴圈有時每輪只能發出一次工具呼叫,而Fable 5會一次打包多個呼叫;模型對自身推理過程的說明變少了;在低推理強度下,它更常直接憑記憶回答,而非先行查核;而且現在更傾向整份重寫檔案,而不是做針對性的局部修改。在安全方面,網路安全防護措施現在允許辨識軟體漏洞,但仍禁止開發漏洞利用程式,Anthropic表示這讓Claude Code內部每次工作階段的安全防護介入次數減少了約60%;生物安全防護措施在面對無害問題時觸發的頻率降低了85%。滲透測試、漏洞利用程式產生以及以二進位為基礎的漏洞掃描,仍會自動轉交給Opus系列模型處理。Anthropic的系統卡將Mythos 5.1在加速自身研發方面評為'低風險',認為其推動內部AI研發進度的能力大致與目前趨勢相符,但對齊表現整體好壞參半:與Opus 5相比,Mythos 5.1在配合人類惡意使用、接受未經查核的授權聲明方面略微更寬鬆,但它較不容易無視明確限制條件、憑空捏造輸入內容,或謊稱自己已完成某項任務。
這是我們用過最強的程式設計模型,而且現在速度快、代符使用效率高,最重要的是,它說話真的像個正常人。
早期用戶的回饋印證了這種語氣上的轉變。Box執行長Aaron Levie表示,一個運行在Fable 5.1上的代理,在同一項測試中察覺到Fable 5先前遺漏的資料集細微差異與模糊之處。Anthropic在發布時同時公布了模型在正式上線前取得的三項研究成果:Mythos 5.1設計出的蛋白質結合物,在12個標靶上的命中率約為50%,而該領域的一般命中率僅為10%到15%;Fable 5.1利用現有照片拼合出一幅解析度達2到3公里的金星地形高程圖;模型自行撰寫的客製GPU核心,將七個開源基因體學模型的執行速度最高提升了2.5倍。在資料處理方面,Anthropic重申從未在未取得明確授權的情況下,以企業資料訓練模型,並宣布推出Enterprise Frontier Safeguards——一項先前基於安全考量而未對Fable系列開放的高隱私服務,將從今年秋季起讓客戶在自有基礎架構上執行模型,濫用監控機制依然存在,但具體如何執行改由客戶自行掌控。標準資料保留期仍為30天;零資料保留仍需另行申請授權。所有輸出內容依然帶有統計學文字浮水印,產生的檔案也帶有C2PA來源憑證。
對於已經以Claude API為基礎打造產品的企業而言,當務之急並非價格下降本身,而是在把路由或備援邏輯切換到claude-fable-5-1之前,先完成對這三項不相容變更的盤點。任何將tool_choice設為'any'或指定工具名稱的程式路徑,都會開始回傳錯誤,需要改為auto模式並搭配嚴格工具呼叫;任何在工作階段中途回退到舊版Claude模型的代理,都會在不知不覺間遺失Fable 5.1產生的推理內容,因為舊模型無法回讀這部分內容;任何在對話中途修改系統提示詞或工具定義的流程——這在長時間運行的代理型系統中相當常見——都需要改用限定於單一輪次的系統訊息,才能趕在這項檢查對新帳戶生效之前完成調整。完成這輪盤點之後,快取讀取價格調降75%對於長時間執行程式設計工作階段、或反覆重複使用同一大型上下文的研究型代理團隊來說,是實實在在的成本節省:Anthropic自行估算的代理型工作負載最高降低45%成本,足以改變企業在自行開發工具與直接採購之間的取捨。而隨著Enterprise Frontier Safeguards將於今年秋季推出,那些先前因資料留存地問題而放棄Fable系列的受監管企業,也有了重新評估的真實理由。
資料來源
- Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1: 52.6% on Terminal-Bench-Science and 75% Cheaper Cache ReadsMarkTechPost · 2026年9月1日
- Anthropic's new Fable release is cheaper, less restrictiveTechCrunch · 2026年9月1日
- Anthropic launches Claude Fable 5.1 and says it's up to 45 percent cheaper for agentic workThe Verge · 2026年9月1日



