NerfBench 首批复测:未发现 Claude Opus 5.5 被暗中削弱
alejandroll10 · x · 2026-09-28
NerfBench 项目公布首批复测结果,将模型当前表现与其发布时成绩对比,以检验厂商是否暗中"削弱"已发布模型。
- Claude Opus 5.5:复测得分 99.2%,较发布时下降 0.8%
- GPT 6 Astra:复测得分 102.8%,较发布时上升 2.8%
- 结论:未检测到 nerf(削弱),Opus 5.5 的小幅下滑与 GPT 6 的小幅提升均在正常波动范围内
项目方表示后续将覆盖更多模型并进行更频繁的复测,数据积累会让 NerfBench 更可靠,并公开征集下一批复测对象。
所属事件:NerfBench 复测 Claude Opus 5.5 未见暗中削弱(2 条相关)→
「模型」频道最新
- Claude Code 按量付费 15 分钟烧光 $50,用户直呼不可用 — RileyRalmuto · 2026-09-28
- 开发者实测 Opus 5.5:编码体验「像在飘」 — Rasmic · 2026-09-28
- Diplomacy 测试:Claude 最爱撒谎,GPT-6 Astra 靠实力不背叛 — teortaxesTex · 2026-09-28
- 本地模型无用论如同比特币无用论:抗审查者的自由工具 — csuwildcat · 2026-09-28
- 马斯克发帖确认 Grok 升级,用户实测速度明显变快 — elonmusk · 2026-09-28
- 一句话框架走红:System 2 建造大脑,System 1 在建神经系统 — ai · 2026-09-28