BlackHalo logo
Published on

Claude Sonnet 5.5:速度提升30%,成本降低30%,性能全面升级

Authors
  • Name
    D2OQZG8l5BI1S06
    anthropic.com
Sonnet 5.5 相关头图
头图来源: 来源页面

模型概述

Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二个模型。作为 Claude Opus 5.5 的快速、低成本补充,Sonnet 5.5 在处理范围明确、日常化的工作任务时表现最为突出,尤其擅长修复代码错误、创建文档、幻灯片和电子表格,并且在设计方面具有敏锐的洞察力。与前一版本 Sonnet 5 相比,Sonnet 5.5 在性能、协作、成本、速度和安全对齐五个核心维度上均实现了显著提升。它比 Sonnet 5 运行速度快 30% 以上,并且对于大多数工作成本可降低最多 30%。后续还将推出专为高吞吐量和成本敏感应用设计的 Claude Haiku 5.5。

主要改进:性能、协作、成本、速度与安全

性能方面:Sonnet 5.5 在多个基准测试中实现了跨越式进步。在 Terminal-Bench 4.0 代理编码评测中,得分从 10.3% 跃升至 70.6%。在衡量跨职业实际工作能力的 GDPval-AA 测试中,得分仅比 Opus 5.5 低 2 分。它还是首个仅凭屏幕截图就能通关《宝可梦 红》的 Sonnet 模型,展现了强大的长程任务处理能力和图像理解能力。

协作体验:与 Opus 5.5 类似,Sonnet 5.5 的文字表达更加清晰,早期测试者认为它比 Sonnet 5 更适合作为协作伙伴。其快速响应的特点也使它非常适合对较简单的任务进行快速迭代。

成本优化:Sonnet 5.5 的定价与 Sonnet 5 相同——每百万输入 token 2 美元、每百万输出 token 10 美元、缓存读取每百万 token 0.20 美元——但由于在执行相同任务时通常消耗更少的 token,每任务成本可降低最多 30%。

速度提升:Sonnet 5.5 的输出速度比 Sonnet 5 快 30% 以上,成为有史以来最快的 Sonnet 模型。

对齐与安全:在自动化行为审计中,Sonnet 5.5 在大多数对齐指标上优于或持平 Sonnet 5。由于其网络安全能力与 Opus 5 相当,它成为首个配备面向高能力模型的网络防护机制和回退策略的 Sonnet 模型。生物安全防护措施则与 Sonnet 5 保持一致。这些防护仅针对高风险的特定请求,常规的软件开发和生命科学工作不受影响。

基准测试表现

Sonnet 5.5 在多个评估维度上大幅领先 Sonnet 5,甚至在部分测试中以最大努力(Max effort)运行时可以与 Opus 5.5 相匹敌。例如在 Terminal-Bench 4.0 上,Sonnet 5.5 的得分为 70.6%,而 Sonnet 5 仅为 10.3%,Opus 5.5 为 66.4%。在 FrontierCode 1.1(主测集)上,Sonnet 5.5 得分为 46.2%(最大努力),明显高于 Sonnet 5 的 42.4%(最高级 effort),甚至接近 Opus 5.5 和 GPT-6 Sol。在 CursorBench 4.0 上,Sonnet 5.5 得分为 55.5%,远超 Sonnet 5 的 34.1%,仅比 Opus 5.5 低 2.3 个百分点。在知识工作评估 GDPval-AA v2.1 上,Sonnet 5.5 得分为 1844,接近 Opus 5.5 的 1846,而 Sonnet 5 仅为 1449。在多学科推理测试 Humanity's Last Exam 中,Sonnet 5.5 借助工具取得了 64.5%,同样介于 Opus 5.5 的 67.7% 和 Sonnet 5 的 54.9% 之间。在计算机使用(OSWorld 2.1)和图表识别(Chartography)方面,Sonnet 5.5 也展现出了高度竞争力,分别为 80.1% 和 61.6%。

图表数据进一步表明,在多数基准上,Sonnet 5.5 在低或中等努力级别下就能以约十分之一的成本超越 Sonnet 5 的最佳成绩,与 Opus 5.5 形成良好互补;在高努力级别下,它甚至能以相近的成本达到接近 Opus 5.5 的表现。

编码能力

Sonnet 5.5 在编程领域的进步尤为突出。在 FrontireCode 的高努力设置下,其得分比 Sonnet 5 高出 10 个百分点,而每任务成本仅为后者的约十五分之一。在 CursorBench(模拟真实编码会话的多文件模糊任务)上,其最佳得分与 Opus 5.5 仅差 2 个百分点。早期测试者称赞它能快速理解代码库,并且效率极高——相比 Sonnet 5,它能更有效地批量调用工具,从而减少步骤、降低成本。多个合作伙伴给出了高度评价:Epic Games 首席运营官 Daniel Vogel 指出,Sonnet 5.5 在系统设计审计和数据流审查中达到了更高层级模型的质量水准,轻松处理数万行代码的游戏系统架构,同时保持快速响应并完成多小时的连贯任务,所需提示也更简洁。CodeRabbit 的 AI 副总裁 David Loker 表示,Sonnet 5.5 在复杂程度不同的任务中展现出更出色的判断力,同时大幅减少输出 token——之前 Sonnet 5 频繁搜索网页和高 token 消耗的问题已不复存在。Base44 的 AI 工程主管 Gabriel Grinberg 提到,在 118 个真实应用构建中,Sonnet 5.5 平均 3.6 次迭代即可完成一个构建,而 Opus 5 需要 7.7 次,并且工具调用失败最少,几乎不会中途停下来向用户提问。Unity 的创意技术专家 Sam Zhang 说,Sonnet 5.5 的多数工作通过了严格的任务完成检查,在 Unity 编辑器与编码的多步骤基准测试中完成了 90% 的任务,优于同类模型。Creator 的创意编程师 Kevin Ngo 则表示,一旦 Opus 5.5 设定了游戏的架构和框架,他完全放心让 Sonnet 5.5 去实现。

知识工作能力

在知识工作领域,Sonnet 5.5 同样展现了显著提升。在横跨 44 个职业和 9 个主要行业的 GDPval-AA 测试中,它得分 1844,几乎与 Opus 5.5 的 1846 持平,比 Sonnet 5 高出约 400 分。在计算机使用和图表识别方面逼近 Opus 5.5,并在长程知识工作上明显超越 Sonnet 5 和 GPT-6 Sol。早期测试者指出,除了可量化的改进,Sonnet 5.5 还是更自然的对话伙伴,并且具有设计天赋——它能美化用户界面,并能按照幻灯片模板生成几乎无需修改的演示文稿。在一次内部测试中,它拿到一家上市公司的季度财报资料和电话会议记录,以及一个幻灯片模板,要求制作 10 页运营回顾。两位专家评价其初稿已经可以直接发送。

合作伙伴的反馈印证了这些优势:Slack 首席工程师 Curtis Allen 表示,在不改变任何提示的情况下,Sonnet 5.5 在几乎所有离线 Slackbot 评测中表现优于 Sonnet 5,步骤更少,输出 token 减少约 14%。Zendesk AI 总监 Abhinay Kathuria 提到,Sonnet 5.5 处理数百个真实支持用例时,错误决策更少,工单解决速度加快 20%。Balyasny Asset Management 高级 AI 工程师 Joe Poirier 指出,在包含 2,441 个金融任务(问答、提取、分析、预测)的私有套件中,Sonnet 5.5 得分领先 Sonnet 5,且每个答案平均使用 121k token,而 Sonnet 5 使用 497k token;在分析师搜索和检索工作中几乎全面占优。Box 工程副总裁 Yashodha Bha 评论说,Sonnet 5.5 在金融服务和医疗保健领域能给客户带来信心,因为它会重新核对源文件中的数据,发现 Sonnet 5 忽略的错误;相比上一代模型,它更准确、速度快 2.4 倍,总 token 消耗减少 12%。

总结

Claude Sonnet 5.5 通过速度、成本和质量的多重改进,重新定义了中等规模模型的性能标杆。它在编程、知识工作、设计等方面表现突出,尤其适合需要快速迭代和高效执行的日常任务。与 Opus 5.5 的协同使用,能在不同复杂度的工作中实现最佳的性能与成本平衡。随着后续 Haiku 5.5 的推出,Claude 5.5 系列将覆盖从高吞吐低延迟到高推理深度的完整应用场景。

原标题:Sonnet 5.5。 HN 原始发布时间:2026年9月29日星期二。当前记录为 646 分、436 条评论。

阅读原文 · 查看 HN 讨论