BlackHalo logo
Published on

Claude Fable 5.1与Mythos 5.1:更强、更省、更安全的AI新旗舰

Authors
  • Name
    denysvitali
    anthropic.com
Anthropic发布Claude系列AI模型的概念示意图
头图来源: 来源页面

模型发布概览

Anthropic 正式发布 Claude Fable 5.1 与 Claude Mythos 5.1。二者本质上是同一模型,但配置了不同级别的安全防护。Fable 5.1 面向公众全面开放,而 Mythos 5.1 仅通过可信访问计划提供,其安全设计专门针对网络安全与生命科学领域的研究需求。官方称这些模型是目前世界上用于编程和知识工作最先进的模型,其研究能力也展示了 AI 模型未来在科学进步中可能扮演的角色。

价格与数据保留的突破

Fable 5.1 在定价上做出了重要调整。对于按 token 计费的典型工作负载,其成本比 Fable 5 下降约 25%;针对高度代理型(agentic)工作,节省幅度可达约 45%。这主要归功于对缓存读取(cache reads)费用的下调,即模型读取已处理并存储的输入内容时的计价降低。

数据保留方面,Anthropic 推出了新的企业前沿防护系统(EFS),为客户提供完全隐私——效果等同零数据保留策略,同时仍具备业界领先的对抗恶意使用能力。EFS 将数据存储在完全由客户控制的云基础设施中,而非 Anthropic 的服务器。该系统将在今年秋季晚些时候分阶段向企业客户开放。在 EFS 可用之前,符合条件的客户可以使用零数据保留选项运行 Fable 5.1。

安全机制的改进与分级访问

Anthropic 改进了安全防护,以减少将良性内容误判为有害内容的误报率。在网络安全领域,新一代防护机制相比之前减少了 60% 的误报。这些改进源于 Fable 5.1 能力的提升:模型现在可以用于发现软件漏洞,但不能开发针对这些漏洞的利用程序。

对于生物学能力,Anthropic 与美国政府合作建立了一个访问计划,允许经过批准的科学家使用 Claude Mythos 5.1 的高级生物学功能。该计划预计很快将开放申请,这为前沿模型在敏感科学领域的受控应用开创了新的合作模式。

性能基准与新纪录

Claude Fable 5.1 在编程、知识工作和长周期问题求解等任务上树立了新的性能标杆。在多个基准测试中,Fable 5.1 显著超越其前代 Fable 5,并且当设置为低或中等努力水平时,能以更低成本取得与 Fable 5 更高努力水平相当甚至更好的结果。值得留意的是,Fable 5.1 在 Claude Code 中默认使用高努力模式,而在 Claude Cowork 和 Claude.ai 上默认为中等努力模式。

在具体基准上:

  • Agentic 科学研究(Terminal-Bench-Science 0.1)中,Fable 5.1 取得 52.6% 的准确率,而 Fable 5 为 24.7%,Claude Opus 5 为 29.0%。
  • Agentic 编程(Terminal-Bench 4.0)中,Fable 5.1 为 55.8%,Mythos 5.1 达到 60.9%,大幅领先 Fable 5 的 42.0% 和 GPT-5.6 的 37.3%。
  • 知识工作(GDPval-AA v2)得分 1853,超过 Fable 5 的 1723 与 Opus 5 的 1824。
  • 多学科推理(Humanity's Last Exam)无工具时 60.9%,带工具时 65.0%,均高于对比模型。
  • 商业工作流(AutomationBench)为 31.4%,远超 Fable 5 的 17.1%。
  • 代理型编程(CursorBench 3.2.0)为 73.4%,优于 Fable 5 的 70.5%。

在 OSWorld 2.0 等计算机使用基准上,Fable 5.1 也表现出色(部分匹配率 77.9%,严格匹配率 41.7%)。需要说明的是,这些评测均在启用生产级安全防护的状态下进行,当防护机制介入时某些任务可能被判定为零分,因此实际能力可能高于数字所示。

早期客户的实测反馈

Anthropic 公开了多家早期合作伙伴的反馈,突出了 Fable 5.1 在真实场景中的优势:

  • 投资公司 Millennium 的团队花费四五年未能定位一个极其罕见的崩溃(约百万分之一概率),而 Fable 5.1 成功反汇编外部供应商库,将其与核心转储匹配,最终追溯到该库中的缺陷。
  • MongoDB 的工程师让 Fable 5.1 用三天构建复杂原型,模型自主研究全部服务代码和文档,提出新颖设计,并持续数小时无人值守运行,逐步完成整个原型,每天早上都能看到带完整可视化演示的下一阶段成果。
  • Jane Street 量化研究主管称,Fable 5.1 解决了更多内部编码问题,且在长任务中保持可读性,交易直觉达到业界最优。
  • Ramp 的机器学习工程师描述了一次 38 小时的无人值守运行:模型诊断出先前结果中的标签伪影,自行修正后启动六个并行实验,最终带回结果和下一步建议。
  • Canva 的人工智能主管表示,Fable 5.1 的写作质量显著提升,在盲测中优于 Fable 5,还能在 Canva Code 中构建带真实音乐和节拍匹配的节奏游戏,这是其他模型未能实现的。

这些反馈共同指向几个特点:更低的误报与更高的安全透明度、长任务中的一致性与可读性、创新的问题解决路径,以及更高效的经济性。

展望

Claude Fable 5.1 与 Mythos 5.1 的发布,标志着 AI 模型在性能、成本和安全三者之间取得新的平衡。通过分级安全访问(尤其面向网络与生物科学),Anthropic 尝试在释放先进能力的同时降低滥用风险。EFS 的零数据保留设计也可能成为企业采用云端大模型的重要转折点。随着科学家访问计划即将开放,人工智能在科研自动化中的角色将更加值得期待。

原标题:Claude Fable 5.1 and Claude Mythos 5.1。 HN 原始发布时间:2026年9月2日星期三。当前记录为 964 分、904 条评论。

阅读原文 · 查看 HN 讨论