- Published on
Livenerf:为AI模型发布后的能力衰减建立基准
- Authors
- Name
- bryan0
- github.com

Livenerf:为AI模型发布后的能力衰减建立基准
传言与真相之间
过去几个月,AI社区流传着一种说法:Anthropic会在模型发布几天或几周后“暗中削弱”模型。支持者认为这可能意味着量化、换用更小的模型、降低推理努力或路由变化;怀疑者则认为这只是人们对噪声的模式匹配。双方都缺乏一个发布当天的干净基线来对照,于是争论变成了“感觉”对“感觉”。
Livenerf正是为解决这个问题而生的项目。它在Claude Opus 5.5发布当天启动计时,用30天时间持续追踪模型能力的变化。
什么是Livenerf
Livenerf是一个小型的、无聊的、只追加的基准测试,回答一个问题:模型发布后会不会变差?
项目运行在Claude Max订阅上,通过无头Claude Code调用,不需要API密钥。它每天运行一次完整面板,持续30天,其中前10天作为基线,之后两个10天窗口用于检测变化。
方法论:如何让不确定的模型变得可测量
大语言模型本质上是随机的——采样参数不可用,思考无法关闭。Livenerf的策略是让其他一切变得确定:
- 冻结提示词
- 固定CLI版本
- 使用精确的评分器
- 永久保存原始日志
统计方法遵循Anthropic自己的《Adding Error Bars to Evals》论文,使用配对逐项差异和聚类标准误,没有自制的统计方案。
校准面板:只保留有信息量的问题
项目从GPQA Diamond、MMLU-Pro、竞赛数学和AIME 2025-26中筛选了2336个问题,每个问题采样4次。Opus 5.5在约93%的问题上首次尝试就答对,97%的问题总是对或总是错。最终78个“有时对”的问题组成了校准面板。
这个设计很聪明:一个模型总能答对的问题无法显示性能下降,运行它们只是浪费token。只有模型“有时答对”的问题才对检测变化有信息量。
控制组与验证
为了区分“模型变差”和“环境变化”,项目同时运行一个控制模型(claude-opus-5),每天用相同管道运行面板的GPQA问题。如果两个模型一起移动,说明是平台或管道变了,而不是Opus 5.5的问题。
在信任任何结果之前,项目先验证工具本身:测量已知的性能下降(降低推理努力),并运行A/A检查确认误差条是诚实的。
当前进展
截至2026年9月30日,项目已收集7天数据(基线完成7/10),没有错过任何一天。所有7天都运行了完整的90个样本,使用相同的管道哈希和固定的CLI版本。
初步验证显示:
- 降低推理努力:输出token减少62%,准确率下降8.3±4.5个百分点
- 中等推理努力:token减少26%,准确率下降4.2±3.9个百分点
- 换成Opus 5无法在99%置信度下区分(-3.8±6.3个百分点,-23% token)
局限与意义
这个工具无法检测同系列模型的小规模替换——验证中Opus 5和Opus 5.5的差异在统计上不可区分。10天窗口的样本量约为验证的2.5倍,但尚未证明足够。
项目还发现78个问题中有8个答案键看起来有误,30个问题存在歧义——这正是“强模型有时答对”的问题的典型特征。预注册的敏感性分析会在排除这些问题后重新运行结果。
结语
Livenerf代表了一种值得注意的开源协作方式:用预注册协议、统计严谨性和长期运行来回答一个容易陷入“各说各话”的问题。无论最终结果如何,它都为AI模型的可信度评估提供了一个可复用的框架。
原标题:Livenerf: Has Opus 5.5 been nerfed yet?。 HN 原始发布时间:2026年9月30日星期三。当前记录为 885 分、378 条评论。