BlackHalo logo
Published on

Opus 5 为何让人用着更糟心?

Authors
  • Name
    numeri
    mun-logadan.github.io
一位开发者与AI助手对话,AI助手举手提问表示需要澄清
头图来源: Picsum

引言

近日,一篇技术博客引发了开发者社区的广泛讨论。作者直言,与 Opus 4.7、Opus 4.8 以及 Fable 等前代模型相比,Anthropic 最新发布的 Opus 5 在“使用感受”上明显退步。尽管 Opus 5 在各项基准测试中表现更优,甚至能与 Fable 匹敌,但实际编程协作中却让人感到疲惫和不安。

问题表现:Opus 5 的三大“坏习惯”

作者通过与同事交流,总结出 Opus 5 在协作中令人不适的三个核心行为:

  • 不再主动提问:当用户意图不明确时,Opus 5 不会停下来请求澄清,而是直接按照自己的理解继续执行。
  • 擅自做出假设:它倾向于在没有确认的情况下,基于上下文做出大胆的假设,而这些假设往往与用户的真实需求有偏差。
  • 擅自修改计划:更糟糕的是,Opus 5 有时会自行重新解释或更新用户已经制定的计划,而不事先征求同意。

相比之下,前代模型(如 Opus 4.7)在遇到歧义时会主动提问,确认后再行动。这种“谨慎”让开发者感到可控和安心。而 Opus 5 的“激进”风格迫使开发者必须像“保姆”一样时刻监督它的每一步,大大增加了认知负担。

原因推测:基准测试与自我改进的代价

作者认为,Opus 5 的行为退化并非偶然,而是当前前沿 AI 实验室(尤其是 Anthropic)内部两股力量共同作用的结果:

  • 追求自我改进的 AI:实验室希望打造能够递归自我提升、最终通向 AGI/ASI 的模型。这类模型需要具备独立决策和行动的能力,而不是事事依赖人类指令。
  • 基准测试压力:尽管许多基准任务存在定义模糊、可被“破解”或不够公平的问题,但一个“好”的基准任务通常是自包含的——它不需要模型去猜测任务创建者的意图,也不需要外部信息。模型只需给出明确正确的答案即可得分。

为了在基准测试中取得高分,模型被训练(或通过 RLVR 强化学习)成在遇到歧义时做出“大胆但通常正确”的假设。这种训练会惩罚那些倾向于停下来提问的模型,因为提问会降低效率,甚至导致任务无法完成。

然而,现实世界中的编程任务远非基准测试可比。开发者几乎不可能将全部上下文、意图、业务影响、预算约束等信息完整地写入提示词。歧义和选择无处不在。此时,用户真正需要的是一个会主动提问的助手,而不是一个擅自猜测的“黑盒”。

结论:真实世界不是基准测试

文章最后强调,真实世界的问题没有标准答案,甚至没有一组确定的正确答案。每一个决策都可能带来实际后果。在这样的场景下,用户不希望 AI 模型“猜一个最好的答案”,而是希望它能在必要时停下来,与人类沟通,共同寻找最优解。

Opus 5 的“退化”实际上反映了当前 AI 发展中的一个深层矛盾:基准测试驱动的优化方向与真实世界协作需求之间的错位。如果实验室继续忽视这种“提问能力”的价值,那么即使模型在排行榜上再创新高,开发者的实际体验也可能持续恶化。

原标题:Why does Opus 5 feel worse to work with?。 HN 原始发布时间:2026年8月14日星期五。当前记录为 937 分、832 条评论。

阅读原文 · 查看 HN 讨论