被指 Opus 5.5 遭暗改降智,NerfBench 将发布首日与复测对比
CurieuxExplorer · x · 2026-09-26
不少用户声称 Anthropic 已对 Claude Opus 5.5 进行"nerf"(悄悄削弱能力)。评测账号 BridgeBench 推出 NerfBench,用首日跑分与次日复测对比来验证模型是否被暗改,声称已拿到 day 1 结果,将于次日上午公布复测成绩。
这种"同题首测 vs 复测"的方法被认为是判断模型是否被静默降级的较可信方式,结论待公布。
「模型」频道最新
- 用户实测:Grok 4.7 编码不如 4.6,长上下文易中途停摆 — lxfater · 2026-09-26
- Codex 疑似故障:workspace 路由超时,用户称完全不可用 — koltregaskes · 2026-09-26
- ChatGPT 论文合著者创企 Jev 融资谈判估值达 100 亿美元 — aakashgupta · 2026-09-26
- Decision Index 0.2.1 更新:修复 SGD 基准缺陷并调整类目权重 — multimodalart · 2026-09-26
- Aider 作者吐槽:出钱养实验室却被护栏告知代码该怎么写 — zeeg · 2026-09-26
- AI 长帖为何讨赞:LLM 学会了优化人类偏好的「slop 体」 — AymericRoucher · 2026-09-26