- Published on
Claude Opus 5:性能飞跃,成本减半,智能体能力显著增强
- Authors
- Name
- alvis
- anthropic.com

模型发布与定位
Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。该模型被定位为 Opus 系列的重大升级,其智能水平接近旗舰模型 Claude Fable 5,但价格仅为后者的一半。Opus 5 旨在成为日常使用的默认模型,现已作为 Claude Max 的默认模型和 Claude Pro 上最强的模型。
性能与成本效益
Claude Opus 5 在保持与上一代 Opus 4.8 相同成本的前提下,实现了性能的大幅提升。用户可以通过调整模型的“努力程度”设置,在智能水平与速度/成本之间进行优化。
- 编程任务:在 Frontier-Bench v0.1 上,Opus 5 超越所有其他模型,性能是 Opus 4.8 的两倍以上,且单任务成本更低。在 CursorBench 3.2 上,以最大努力运行时,其得分与 Fable 5 的峰值相差不到 0.5%,但成本减半。
- 知识工作与问题解决:在 ARC-AGI 3 评估中,Opus 5 的得分是次优模型的三倍。在 Zapier AutomationBench 上,其任务完成率约为次优模型的 1.5 倍,且成本相同。即使在最低努力设置下,它完成的任务也超过其他任何模型。在 OSWorld 2.0 计算机使用基准测试中,Opus 5 以任何给定成本均优于所有其他模型,以略高于 Fable 5 三分之一成本便超越了其最佳结果。
科学研究能力提升
Opus 5 在科学研究领域相比 Opus 4.8 有显著进步。在生命科学评估的所有方面,包括结构生物学、有机化学和生物信息学,其表现均优于前代。
- 有机化学:从光谱数据推断分子结构的任务中,Opus 5 的内部基准得分比 Opus 4.8 高出 10.2 个百分点。
- 蛋白质相关任务:预测蛋白质序列变异如何影响其功能的任务中,得分高出 7.7 个百分点。
自主性与验证能力
Opus 5 在验证自身工作并迭代直至成功方面表现出色。早期测试中发现了许多体现其自主性和彻底性的案例。
- 复杂问题解决:在一个 Frontier-Bench 任务中,模型被要求根据一张机器零件图纸编写代码重建 3D 模型,但被故意不提供直接查看图纸的途径。Opus 5 自行编写了计算机视觉管线从原始像素中提取几何信息,并成功重建了零件。
- 深度调试:面对一个流行开源包管理器中的真实 bug,Opus 5 找到了根本原因并修复了社区补丁遗漏的边缘情况,而竞争模型只修复了表面症状。
- 自主构建测试工具:一位交易公司的工程师使用 Opus 5 构建新交易所的市场数据源,由于没有实时数据源进行验证,Opus 5 自行构建了测试工具来检查代码是否正确解析了数据。
早期用户反馈
来自早期访问客户的反馈强调了 Opus 5 在多个领域的优势。
- 编程与调试:在 FrontierCode 1.1 上,Opus 5 以一半成本达到接近 Fable 的性能。在 Devin 中,它在困难调试和根因分析任务上表现出色。
- 自动化工作流:在 Zapier 的 AutomationBench 上,Opus 5 以不高于前代模型的 token 消耗量登顶排行榜。它能端到端地处理客户流失预防流程。
- 科学分析:在基因组学分析中,Opus 5 表现得像一位严谨的科学家,会选择合适的统计检验排除混杂因素,并通过独立方法交叉验证结果。
- 前端开发:Opus 5 会像真正的开发者一样检查自己的工作,在浏览器中打开页面检查桌面和手机宽度下的显示效果,并修复了移动端折叠区域下的隐藏产品等问题。
- 法律与金融:在法律代理工作中,Opus 5 在公司治理和仲裁等领域提升最大。在金融建模任务中,其准确性和效率均有显著提升。
- 判断力:多位用户称赞 Opus 5 的判断力。它会在行动前仔细思考,在规划阶段而非事后发现逻辑错误,并能就设计问题提出有建设性的妥协方案。
对齐与安全
在部署前测试中,Opus 5 被认定为迄今为止最对齐的模型。它比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵守 Claude 的宪法,表现出最低的欺骗行为率,且最不容易被诱导滥用。在避免鲁莽行为方面,它也是 Anthropic 最安全的模型。
原标题:Claude Opus 5。 HN 原始发布时间:2026年7月25日星期六。当前记录为 1325 分、715 条评论。