Claude Fable 5.1发布,智能体任务最高降价45%
Claude Fable 5.1在Terminal-Bench-Science基准测试中取得52.6%的成绩,缓存读取价格下调75%,同时带来三项不向下兼容的API变更,已经在使用Claude的团队需要留意。

Anthropic于9月1日发布了Claude Fable 5.1与Claude Mythos 5.1,距离Fable 5系列在2026年6月推出仅三个月。两款模型其实是同一个底层系统,只是套用了不同的安全防护层:Fable 5.1以claude-fable-5-1的API名称面向公众开放,而Mythos 5.1仍然只提供给通过审核的合作机构。Anthropic用三个数字概括这次发布:在面向科研任务的Terminal-Bench-Science 0.1基准测试中取得52.6%的成绩,是Fable 5的24.7%的两倍多;缓存读取价格下调75%,从每百万个词元1.00美元降至0.25美元;在复杂的智能体工作负载中,最高可节省45%的成本。
Fable 5.1从今天起可通过Claude API、亚马逊Bedrock、AWS上的Claude、谷歌云以及微软Foundry使用。相比之下,Mythos 5.1只面向加入Project Glasswing的机构开放,这是Anthropic为从事网络安全或生命科学研究的合作伙伴设立的审核项目。两款模型都配备100万词元的上下文窗口、最高12.8万词元的输出上限,并且默认开启自适应推理,没有单独的开关可以关闭。
基准测试真正说明了什么
在围绕真实科研任务构建的智能体基准测试Terminal-Bench-Science 0.1中,Fable 5.1取得52.6%,领先于Anthropic自家的Opus 5(29.0%)、Fable 5(24.7%)以及OpenAI的GPT-5.6 Sol(22.4%)。Anthropic自己也提醒,每个模型的标准误差在3.5到4.5个百分点之间,因此排名顺序比两个分数之间的具体差距更值得关注。在面向命令行编程任务的Terminal-Bench 4.0中,Fable 5.1取得55.8%,而Mythos 5.1达到60.9%——这是两个本质相同的模型之间的差距,Anthropic直接将其归因于安全防护措施的代价,这种坦诚在模型厂商中并不常见。
- Terminal-Bench-Science 0.1:Fable 5.1为52.6%,对比Opus 5的29.0%、Fable 5的24.7%、GPT-5.6 Sol的22.4%
- Terminal-Bench 4.0:Fable 5.1为55.8%,Mythos 5.1为60.9%
- Humanity's Last Exam:不使用工具时60.9%,使用工具时65.0%
- CursorBench 3.2.0:73.4%
- AutomationBench 31.4%,OSWorld 2.0(严格模式)41.7%
价格为什么下降
基础价格保持不变:输入每百万词元10美元,输出每百万词元50美元。这次降价针对的是缓存内容:从提示词缓存中读取现在每百万词元只需0.25美元,而不是1.00美元,相当于基础输入价格的0.025倍,而其他所有Claude模型的这一比例都是0.1倍。Anthropic估计,典型工作负载的成本大约会降低25%,而在反复复用大型上下文窗口的智能体任务中,降幅最高可达约45%——这正是长时间编程会话或多步骤研究型智能体的典型使用模式。对于可以容忍延迟的批处理任务,价格仍维持在每百万词元5美元和25美元。
三项不向下兼容的API变更,会影响现有集成
Anthropic还记录了三项不向下兼容的API变更,直接针对已经基于Claude构建产品的团队。强制工具调用被取消:将tool_choice设置为'any'或指定某个工具,现在会返回400错误,Anthropic建议改用auto模式,并配合严格工具调用或结构化输出。推理块现在与模型绑定——Fable 5.1可以读取早期Claude模型生成的推理块,但没有一个早期模型能够回读自己的推理内容,这会破坏那些在对话中途悄悄降级到旧模型的路由或回退机制。修改此前的对话轮次现在会使推理块完全失效:在对话中途插入或删除按轮次的提醒信息,或者重建系统提示词、工具数组,都会直接报错,而不再被默默接受。这项检查适用于2026年8月31日之后创建的账户,Anthropic建议的解决办法是改用限定在单轮对话内的系统消息,以及服务器端的上下文编辑功能。
- 取消强制工具调用:tool_choice设为'any'或'tool'现在会返回HTTP 400错误
- 推理块与模型绑定:旧模型无法回读Fable 5.1生成的推理内容
- 修改此前的对话轮次会报错:对话中途重建系统提示词或工具数组的做法被禁止
Anthropic在公布进步的同时,也列出了确实存在的退步。并行工具调用变得更不稳定,导致智能体循环有时每轮只能发出一次工具调用,而Fable 5会一次性打包多次调用;模型对自身推理过程的叙述变少了;在低推理强度下,它更多依赖记忆直接作答,而不是先核实;并且现在更倾向于整体重写文件,而不是做针对性的局部修改。在安全方面,网络安全防护措施现在允许识别软件漏洞,但仍然禁止开发漏洞利用程序,Anthropic表示这使Claude Code内部每次会话的安全防护介入次数减少了约60%;生物安全防护措施在面对无害问题时触发的频率降低了85%。渗透测试、漏洞利用程序生成以及基于二进制文件的漏洞扫描,仍会自动转交给Opus系列模型处理。Anthropic的系统卡将Mythos 5.1在加速自身研发方面评为'低风险',认为其推动内部AI研发进展的能力与当前趋势基本一致,但对齐情况整体喜忧参半:与Opus 5相比,Mythos 5.1在配合人类恶意使用、接受未经核实的授权声明方面表现得略微更宽松,但它更不容易无视明确的限制条件、凭空捏造输入内容,或谎称自己已完成某项任务。
这是我们用过的最强编程模型,而且现在速度快、词元使用效率高,最重要的是,它说话真的像一个正常人。
早期用户的反馈印证了这种语气上的变化。Box首席执行官Aaron Levie表示,一个运行在Fable 5.1上的智能体,在同一项测试中察觉到了Fable 5此前遗漏的数据集中的细微差别和歧义之处。Anthropic在发布时还公布了模型在正式上线前取得的三项科研成果:Mythos 5.1设计出的蛋白质结合物,在12个靶点上的命中率约为50%,而该领域的常规命中率仅为10%到15%;Fable 5.1利用现有照片拼合出一幅分辨率达2到3公里的金星地形高程图;模型自行编写的定制GPU内核,将七个开源基因组学模型的运行速度最高提升了2.5倍。在数据处理方面,Anthropic重申从未在未获得明确授权的情况下,使用企业数据训练模型,并宣布推出Enterprise Frontier Safeguards——一项此前出于安全考虑而未向Fable系列开放的高隐私服务,将从今年秋季起允许客户在自己的基础设施上运行模型,滥用监测机制依然保留,但具体如何执行由客户自行掌控。标准数据保留期仍为30天;零数据保留仍需单独申请授权。所有输出内容依旧带有统计学文本水印,生成的文件也带有C2PA来源凭证。
对于已经基于Claude API构建产品的企业而言,当务之急并不是价格下降本身,而是在把路由或回退逻辑切换到claude-fable-5-1之前,先完成对这三项不兼容变更的排查。任何将tool_choice设置为'any'或指定工具名称的代码路径,都会开始返回错误,需要改为auto模式并配合严格工具调用;任何在会话中途回退到旧版Claude模型的智能体,都会在不知不觉中丢失Fable 5.1生成的推理内容,因为旧模型无法回读这部分内容;任何在对话中途修改系统提示词或工具定义的流程——这在长时间运行的智能体系统中是常见做法——都需要改用限定在单轮对话内的系统消息,才能赶在这项检查对新账户生效之前完成迁移。完成这轮排查之后,缓存读取价格下调75%对于长时间运行编程会话、或反复复用同一大型上下文的研究型智能体团队来说,是实实在在的成本节约:Anthropic自己估算的智能体工作负载最高降低45%成本,足以改变企业在自建工具与直接采购之间的取舍。而随着Enterprise Frontier Safeguards将于今年秋季推出,那些此前因数据留存地问题而放弃Fable系列的受监管企业,也有了重新评估的真实理由。
信息来源
- Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1: 52.6% on Terminal-Bench-Science and 75% Cheaper Cache ReadsMarkTechPost · 2026年9月1日
- Anthropic's new Fable release is cheaper, less restrictiveTechCrunch · 2026年9月1日
- Anthropic launches Claude Fable 5.1 and says it's up to 45 percent cheaper for agentic workThe Verge · 2026年9月1日



