BlackHalo logo
Published on

Livenerf:为AI模型发布后的能力衰减建立基准

Authors
  • Name
    bryan0
    github.com
AI模型基准测试概念图
头图来源: Wikimedia Commons(请在文件页查看原作者与许可条款)

Livenerf:为AI模型发布后的能力衰减建立基准

传言与真相之间

过去几个月,AI社区流传着一种说法:Anthropic会在模型发布几天或几周后“暗中削弱”模型。支持者认为这可能意味着量化、换用更小的模型、降低推理努力或路由变化;怀疑者则认为这只是人们对噪声的模式匹配。双方都缺乏一个发布当天的干净基线来对照,于是争论变成了“感觉”对“感觉”。

Livenerf正是为解决这个问题而生的项目。它在Claude Opus 5.5发布当天启动计时,用30天时间持续追踪模型能力的变化。

什么是Livenerf

Livenerf是一个小型的、无聊的、只追加的基准测试,回答一个问题:模型发布后会不会变差?

项目运行在Claude Max订阅上,通过无头Claude Code调用,不需要API密钥。它每天运行一次完整面板,持续30天,其中前10天作为基线,之后两个10天窗口用于检测变化。

方法论:如何让不确定的模型变得可测量

大语言模型本质上是随机的——采样参数不可用,思考无法关闭。Livenerf的策略是让其他一切变得确定:

  • 冻结提示词
  • 固定CLI版本
  • 使用精确的评分器
  • 永久保存原始日志

统计方法遵循Anthropic自己的《Adding Error Bars to Evals》论文,使用配对逐项差异和聚类标准误,没有自制的统计方案。

校准面板:只保留有信息量的问题

项目从GPQA Diamond、MMLU-Pro、竞赛数学和AIME 2025-26中筛选了2336个问题,每个问题采样4次。Opus 5.5在约93%的问题上首次尝试就答对,97%的问题总是对或总是错。最终78个“有时对”的问题组成了校准面板。

这个设计很聪明:一个模型总能答对的问题无法显示性能下降,运行它们只是浪费token。只有模型“有时答对”的问题才对检测变化有信息量。

控制组与验证

为了区分“模型变差”和“环境变化”,项目同时运行一个控制模型(claude-opus-5),每天用相同管道运行面板的GPQA问题。如果两个模型一起移动,说明是平台或管道变了,而不是Opus 5.5的问题。

在信任任何结果之前,项目先验证工具本身:测量已知的性能下降(降低推理努力),并运行A/A检查确认误差条是诚实的。

当前进展

截至2026年9月30日,项目已收集7天数据(基线完成7/10),没有错过任何一天。所有7天都运行了完整的90个样本,使用相同的管道哈希和固定的CLI版本。

初步验证显示:

  • 降低推理努力:输出token减少62%,准确率下降8.3±4.5个百分点
  • 中等推理努力:token减少26%,准确率下降4.2±3.9个百分点
  • 换成Opus 5无法在99%置信度下区分(-3.8±6.3个百分点,-23% token)

局限与意义

这个工具无法检测同系列模型的小规模替换——验证中Opus 5和Opus 5.5的差异在统计上不可区分。10天窗口的样本量约为验证的2.5倍,但尚未证明足够。

项目还发现78个问题中有8个答案键看起来有误,30个问题存在歧义——这正是“强模型有时答对”的问题的典型特征。预注册的敏感性分析会在排除这些问题后重新运行结果。

结语

Livenerf代表了一种值得注意的开源协作方式:用预注册协议、统计严谨性和长期运行来回答一个容易陷入“各说各话”的问题。无论最终结果如何,它都为AI模型的可信度评估提供了一个可复用的框架。

原标题:Livenerf: Has Opus 5.5 been nerfed yet?。 HN 原始发布时间:2026年9月30日星期三。当前记录为 885 分、378 条评论。

阅读原文 · 查看 HN 讨论