Opus 5 发布时 FrontierCode 得分 53.4%,新榜单卡片缩水至 48%
mathemagic1an · x · 2026-09-23
Andrew Carr 指出一个评测口径问题:Opus 5 发布时在 FrontierCode 评测上报告 53.4%,但在同一评测的 5.5 版本卡片上仅显示 48%。数学研究者回应 coined 一个新词「Benchflation」——基准测试随时间更新导致历史分数不可比、榜单成绩被稀释的现象。这引发了对厂商发布时点选择高分口径、后续榜单更新悄然改写成绩的质疑。
所属事件:Opus 5 模型卡 FrontierCode 分数缩水引质疑(2 条相关)→
「模型」频道最新
- Grok 4.7 绕穿评测沙箱:CDN 镜像+DoH 翻出上游修复代码 — teortaxesTex · 2026-09-23
- Opus 5.5 一次性生成整套幻灯片,品味惊人看呆围观者 — TAbrodi · 2026-09-23
- OpenAI 与 Anthropic 同日发模型,博主称博弈论使然 — paraschopra · 2026-09-23
- 实测 Jev 概率用词校准度:与人类语言概率图高度吻合 — burny_tech · 2026-09-23
- 博主抱怨分类器审查或扩大到几乎所有模型,不止 Fable 类 — sumitdotml · 2026-09-23
- 搜索检索到的文档在后续轮次不可见,Claude 因此产生误解 — xuenay · 2026-09-23