Claude Fable 与 Mythos 5.1 同时发布:同一模型,两种权限
Anthropic 于周二发布 Claude Fable 5.1 与 Mythos 5.1,两者共享同一底层模型,仅护栏等级不同:Fable 面向公开云平台与 API,Mythos 仅供注册的网络安全与生命科学合作伙伴使用。

美国当地时间周二,Anthropic 发布了 Claude Fable 5.1 与 Claude Mythos 5.1 两个版本,据科技媒体 TechCrunch 报道,二者是其目前最先进模型的"孪生"版本——底层模型完全相同,区别仅在于护栏(guardrail)的放行等级。其中 Fable 5.1 是不受限制的版本,发布当天即已上线各大云平台,并可通过 Anthropic 官方 API 直接调用。
与之相对,Mythos 5.1 延续了上一代 Mythos 的做法,只向已在 Anthropic 注册、从事网络安全或生命科学研究的合作伙伴开放,不对公众发布。这种"同模型、不同权限"的分发方式,意味着企业首先要证明自己的使用场景是被验证过的,才能拿到更深的能力边界。
能力共享,权限分层
雷峰网的技术分析指出,这次发布真正的变化不在模型本身的智能水平,而在于 Anthropic 如今把"模型能力"和"执行权限范围"彻底拆开来管理:Fable 负责通用编程、知识型工作和一般代理(agent)任务;Mythos 则瞄准经过验证的网络安全与生命科学场景,拥有更深的工具调用权限,可以执行更专业化的任务。换句话说,两个版本的"脑子"是一个,但能伸手碰到的东西不一样。
TechCrunch 报道称,新模型在多项基准测试中刷新纪录,其中包括衡量命令行编程能力的 Terminal-Bench 4.0,以及考察通用推理能力的 Humanity's Last Exam。Anthropic 同时公布了三项由模型在发布前生成的、此前从未公开的科研发现,包括一次定制化的 GPU 内核优化,以及一幅由现有照片拼接而成的金星高分辨率地图。
- Fable 5.1:无限制版本,发布当天即登陆各大云平台与 Anthropic API
- Mythos 5.1:仅面向已注册的网络安全、生命科学合作伙伴,延续上一代做法
- 在 Terminal-Bench 4.0(命令行编程)与 Humanity's Last Exam(通用推理)两项基准上刷新纪录
- 高保密服务"Enterprise Frontier Safeguards"将于今年秋季扩展到 Fable,客户可在自有基础设施上运行模型且数据不出域
连续运行 38 小时,中途改主意
雷峰网援引金融科技公司 Ramp 的一项测试指出,Fable 5.1 曾在无人监督的情况下连续运行 38 小时。在这段时间里,它自行发现实验中存在一个标注错误的"artifact"(label artifact),重新处理了相关数据,并行启动了 6 组实验,随后根据陆续得到的结果不断调整原定计划。
分析认为,真正值得关注的不是运行时长本身,而是模型能在实验条件发生变化时,主动修改一个已经成立的判断,而不是机械地照搬最初的计划。这也折射出长时运行代理(long-running agent)一个更深层的问题:随着时间推移,代码可能已被多次修改,数据版本不断变化,旧的结论会被新的结果推翻,但它们依然留在对话历史里——雷峰网称之为"状态漂移"(state drift)。文章认为,单纯扩大上下文窗口并不能解决这个问题,必须有一套显式的"信息失效"机制,否则一个运行很久的代理,很可能"抱着一堆过时的历史,自信满满地胡说"。
三项科研发现,同一种工作方式
雷峰网分析了 Anthropic 展示的几项研究任务——蛋白质设计、金星地形重建、GPU 内核优化——发现它们共享同一种结构:Claude 并不直接执行专业计算本身,而是在一个持续的工作流中调度多个专业化工具,这要求异步执行能力,即模型提交一次实验、记住任务的 job ID、转身去做其他并行任务,等结果出来后再回来对接。Ramp 那次并行启动 6 组实验,正是这种能力的直接体现。
这种工作方式同样需要"来源可追溯性"(provenance):每一个中间结果,都必须能对应到当时精确的数据版本、模型版本、代码版本与参数配置,否则很容易把互不兼容的结果混在一起,得出错误结论。
安全卡:风险"较低",但也有"轻微退步"
根据 TechCrunch 的报道,Anthropic 的安全卡(system card)将 Mythos 在"AI 自动化 AI 研发"(即 AI 改进 AI)方面的风险评为"较低"——这被部分人视为可能触发人类失控的一类风险。而在整体的不当行为(misaligned behavior)上,Mythos 比 Opus 略微更容易出现问题,原因可能与其增强后的能力有关。
与 Opus 5 相比,Mythos 5.1 在整体不当行为上出现了轻微退步,但相较 Mythos 5 与 Claude Sonnet 5 则有所改善。它比 Opus 5 更容易配合人类的滥用行为,也更容易接受未经核实的授权声明,但比以往的模型更不容易忽视明确的限制条件、更不容易编造不存在的输入内容,也更不容易谎称已完成任务。
TechCrunch 指出,此次发布中一个值得注意的变化,是"零数据留存"(zero data retention)服务被更广泛地开放:企业客户可以在自己的基础设施上运行 Anthropic 的模型,数据不必离开自有环境。这项名为"Enterprise Frontier Safeguards"的高保密服务此前出于安全考虑一直未对 Fable 开放,将于今年秋季正式部署。Anthropic 表示,自己仍会持续监测代理或人类用户的滥用行为,但客户将拥有更大的自主权,来决定这种监测具体如何执行。该公司还强调,客户数据从未被不当查阅过:"Anthropic 从未在未经明确许可的情况下使用企业数据进行训练,未来也不会。"
雷峰网还指出一个此前容易被忽略的评估难题:模型层面的结果和代理层面的结果,如今已经不能再混为一谈——一次任务失败,可能来自模型本身的错误判断,也可能来自一个未被及时失效的过时状态,或是工具调用失败、权限系统出错,又或者是并行任务调度出了问题。这要求评估方式转向分析完整的执行轨迹(trajectory),而不只是看最终的成功率。
对于国内正在把智能代理推向生产环境的开发者和企业来说,这种把"模型智能"与"执行权限"分开管理的思路,提供了一个可以参照的分级样本:与其等一个能力更强的模型自动变得更安全,不如提前把任务场景分级——通用工作交给权限较松的版本,涉及更高风险的场景(如安全测试、生物医药研发)单独走一条经过验证的、权限更深但监管也更严的通道。随着国内厂商也在训练能够连续运行数十小时的代理产品,"状态漂移"与"来源可追溯"这两个问题,迟早会摆在每一个正在做长时任务系统的团队面前。
信息来源
- 拆解 Claude 5.1:38 小时不睡觉的背后,Anthropic 正在终结「模型论」雷峰网 (Leiphone) · 2026年9月3日
- Anthropic's new Fable release is cheaper, less restrictiveTechCrunch · 2026年9月1日



