当地时间 9 月 1 日,美国大模型龙头企业 Anthropic 宣布推出 Claude Fable 5.1 与 Claude Mythos 5.1 两款新模型。Anthropic 将这对「孪生模型」定义为「全球最先进的编程与知识工作模型」,其中 Fable 5.1 面向所有用户与企业全面开放,Mythos 5.1 则仅通过授权访问计划向经过审核的机构提供。这是 Anthropic 继今年 6 月发布 Fable 5 系列之后,在短短三个月内再次更新自家旗舰。
同一底层模型,两套安全策略

根据 Anthropic 官方发布的技术报告,Fable 5.1 与 Mythos 5.1 实际上是同一底层模型的两种配置形态。Fable 5.1 作为公开版本,加装了更为严格的安全护栏,能够防止模型在生物学、网络安全等高风险双重用途领域执行特定任务;Mythos 5.1 则在这些领域采用更为宽松的安全策略,直接访问权限仅限于通过可信访问计划审核的个人和组织,其能力同时为面向所有 Claude 企业客户的 Claude Security 产品提供支持。
Anthropic 表示,这种「同一模型、两套安全策略」的发布模式,旨在推动模型能力前沿突破的同时,有效管控高风险领域的潜在滥用。值得注意的是,两款模型在同一个基准测试中有时会跑出不同的成绩,主要原因正在于安全限制的差异。例如在测试 Agent 终端操作能力的 Terminal-Bench 4.0 上,Fable 5.1 为 55.8%,Mythos 5.1 则达到 60.9%,Anthropic 解释这并非因为 Mythos 底层能力更强,而是部分网络安全任务触发了 Fable 的安全限制。
缓存读取价格大幅下调 75%

价格方面,Fable 5.1 的基础输入和输出价格保持不变,仍为每百万 Token 输入 10 美元、输出 50 美元,与 Fable 5 持平。但缓存读取(Cache Read)价格从此前的每百万 Token 1 美元大幅下调至 0.25 美元,降幅高达 75%。
缓存读取是指模型读取已经处理并存储过的输入内容时的计费项。在实际的智能体任务和长对话场景中,大量重复读取缓存是常态,因此这一降价对实际使用成本的影响远超表面数字。Anthropic 官方测算,在典型工作负载下,Fable 5.1 的使用成本比 Fable 5 低约 25%;而对于高度智能体化的工作负载,成本降幅最高可达约 45%。此外,Fable 5.1 保持了 100 万 Token 的上下文窗口和 12.8 万 Token 的最大输出长度。
Agent 长任务能力大幅跃升

从性能变化来看,Fable 5.1 越来越像一个专为长时间任务准备的模型。在 Anthropic 公布的基准测试中,提升最夸张的是衡量 AI 自主科研能力的 Terminal-Bench-Science 0.1,得分从上一代的 24.7% 飙升至 52.6%,直接翻倍。测试终端环境 Agent 能力的 Terminal-Bench 4.0 从 42.0% 提高到 55.8%,面向复杂商业工作流的 AutomationBench 则从 17.1% 提高到 31.4%。
相比之下,更传统的推理和编码基准提升幅度就没那么夸张。Humanity’s Last Exam 不使用工具时从 57.8% 提高到 60.9%,使用工具后从 63.8% 提高到 65.0%;CursorBench 3.2.0 从 70.5% 提高到 73.4%。总体来看,Fable 5.1 的提升明显集中在需要模型连续调用工具、处理多个步骤、检查中间结果再决定下一步行动的任务,而不是在所有能力上均匀分布。
早期企业测试也在重复这一趋势。Browserbase 在其最难的浏览器 Agent 基准测试中,让 Fable 5.1 完成了 82% 的任务,而 Opus 5 为 74%、Fable 5 只有 57%。Ramp 的一次测试里,Fable 5.1 在无人干预的情况下连续运行了 38 个小时,它先发现此前一个机器学习实验的结果受到标签伪影的影响,随后自行修正问题,同时启动 6 组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。Canva 的反馈则更偏向生成质量,其测试认为 Fable 5.1 的文字表达更容易理解,也更能遵循写作规范。
企业前沿安全护栏与零数据保留

在企业安全方面,Anthropic 同时推出了 Enterprise Frontier Safeguards(EFS)解决方案,试图解决 Fable 级模型过去一个很现实的矛盾:公司既希望保留足够的数据来检测模型滥用,金融、医疗、法律等企业又不愿意把敏感数据交给模型公司长期保存。EFS 的办法是把监控所需的数据直接存放在客户自己控制的云基础设施里,而非 Anthropic 的服务器,默认情况下人工审查也由客户自己完成。
这套机制与超过 100 家来自金融、医疗、制造、电信、法律等行业的客户共同开发,将从今年秋季开始分阶段上线。Anthropic 同时向客户保证,在未获得明确许可的情况下,公司过去从未、未来也绝不会使用企业数据进行模型训练。
IPO 前的一次能力展示

从时间节点来看,Fable 5.1 的发布还有一层特殊含义。据 The Information 此前披露,Anthropic 已在 6 月秘密提交了 IPO 文件,计划在 9 月 7 日美国劳动节之后公开招股书,并在 9 月中旬举行投资者日,最快于 9 月底至 10 月初上市。放在这个时间窗口里,Fable 5.1 很自然地成为了 Anthropic 公开递表前的一次能力展示。
今年 5 月,Anthropic 最近一轮私募估值达到 9650 亿美元;到了 8 月,多名投资者预计其上市估值可能达到 2 万亿美元以上。如此高的估值,已经很难只靠公司当前的收入来解释,市场更看重的是 Claude 在编程、科研和长任务智能体领域所展现出的能力天花板。Fable 5.1 在基准测试和企业实测中的表现,恰好为这一叙事提供了最新的注脚。对于关注大模型行业的人来说,Anthropic 的这次更新,既是一次产品迭代,也是一份面向资本市场的最新答卷。