- Published on
Anthropic 发布 Claude Opus 5.5:性能领先、成本降低40%
- Authors
- Name
- km144
- anthropic.com

引言
Anthropic 于 2026 年 9 月 22 日发布了 Claude Opus 5.5,这是其 Claude 5.5 系列的首个模型。该模型在大多数工作任务上达到 Claude Fable 5.1 的水平,但运行成本比 Opus 5 降低 40%。这是 Anthropic 在呼吁“放缓前沿”后的首次发布,模型在发布前已由外部评估机构(包括 Frontier Design 和 METR)进行测试。
性能提升
Opus 5.5 在多项基准测试中表现领先,尤其在智能体编码、计算机使用和知识工作方面。早期测试者报告了显著的性能飞跃:
- 一名测试者在不到一天内完成了 68 万行代码的迁移,而这项工作通常需要工程团队数周。
- 在要求削减 Web 应用所有页面加载时间的任务中,Opus 5.5 在 40 次尝试中成功了 39 次,而 Opus 5 的改进较小且改变了应用行为。
- 另一测试者让多个 Claude 模型根据单一提示构建游戏,Opus 5.5 在图形和精致度上得分最高。
基准测试数据
在 Terminal-Bench 4.0 上,Opus 5.5 得分 66.4%,领先于 Fable 5.1(55.8%)和 Opus 5(52.3%)。在 FrontierCode v1.1 上,Opus 5.5 得分 54.4%,同样领先。在知识工作基准 GDPval-AA v2.1 上,Opus 5.5 得分 1846,高于 Fable 5.1 的 1735 和 Opus 5 的 1708。在 Humanity's Last Exam 多学科推理测试中,Opus 5.5 使用工具得分 67.7%。
安全与对齐
Opus 5.5 在自动化行为审计中取得了迄今为止所有模型中的最佳分数。该审计是 Anthropic 最全面的对齐测试套件,模拟了数千种场景。与近期模型相比,Opus 5.5 采取难以逆转的行动或超出给定边界的可能性大大降低,并且比 Opus 5 更能抵抗提示注入。Anthropic 还扩展了对齐测试,涵盖更长任务、不可能任务以及基于真实事件的场景。
由于 Opus 5.5 在生物学和网络安全方面与 Claude Mythos 5.1 相当,Anthropic 为其部署了与 Claude Fable 5.1 类似的安全措施。经过审查的组织可以申请生命科学验证计划,以在生物学研究中使用 Opus 5.5。未来几周,网络安全验证计划也将扩大访问范围。
成本与速度
Opus 5.5 的定价显著降低:
- 输入令牌:每百万 4 美元(比 Opus 5 降低 20%)
- 输出令牌:每百万 20 美元(降低 20%)
- 缓存读取:每百万 0.20 美元(降低 60%)
在默认设置下,典型工作负载的总成本比 Opus 5 降低 40%。输出生成速度比 Opus 5 快 30% 以上。此外,Anthropic 还提高了 Pro、Max、Team 和企业计划的五小时使用限制,并为订阅用户提供了速率限制重置功能。
编码能力
Opus 5.5 在大型代码库迁移和审计等长而复杂的任务中表现出色。一名早期测试者用它审计并修复了 20 万行代码库,耗时不到 3 小时,而 Opus 5 需要 20 多小时且使用 2.5 倍令牌。在内部测试中,Opus 5.5 将 HAProxy 从 C 语言翻译为 Rust,耗时 9.5 小时,成本比 Fable 5.1 低 51%,且两者都通过了几乎所有回归测试。
在默认努力水平下,Opus 5.5 在 FrontierCode 上以每任务约 20% 的成本击败 GPT-6 Astra;在 Terminal-Bench 4.0 上以约 40% 的成本匹配 Astra;在 CursorBench 上以约三分之一成本领先 GPT-5.6 Sol 11 个百分点。
沟通改进
Opus 5.5 的沟通更自然。早期测试者发现其写作更清晰、更易理解,解决了 Opus 5 的常见反馈。它把最重要信息放在前面,风格使其在长时间会话中成为更好的工作伙伴。一位测试者表示:“它写得像我一样。”这种改进也带来了安全效益,因为输出更易于跟踪和检查。
后续计划
Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周内发布,具备许多相同的性能、效率和安全性改进。
原标题:Claude Opus 5.5。 HN 原始发布时间:2026年9月23日星期三。当前记录为 1270 分、844 条评论。