Opus 5 发布时 FrontierCode 得分 53.4%,新榜单卡片缩水至 48%

mathemagic1an · x · 2026-09-23

Andrew Carr 指出一个评测口径问题:Opus 5 发布时在 FrontierCode 评测上报告 53.4%,但在同一评测的 5.5 版本卡片上仅显示 48%。数学研究者回应 coined 一个新词「Benchflation」——基准测试随时间更新导致历史分数不可比、榜单成绩被稀释的现象。这引发了对厂商发布时点选择高分口径、后续榜单更新悄然改写成绩的质疑。

所属事件:Opus 5 模型卡 FrontierCode 分数缩水引质疑(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →