研究称五分之一 AI 基准测试在新模型中出现倒退
gleech · x · 2026-08-27
Paradigm 3 的一项新分析揭示了前沿 AI 模型“有时会变差”的现象。在超过 5000 个模型-基准测试对中,约有五分之一的基准分数在连续模型迭代中有所下降,中位数跌幅约为基准范围的 6.5%。
主要发现
- 非均匀倒退:倒退在编程和 STEM 任务中较为罕见,而在写作和创意任务中更为常见。
- 幸存者偏差:越突出或经济价值越高的基准,倒退的可能性越小。这很可能是由于模型发布前的筛选机制:在关键基准上表现倒退的检查点会被弃用。
- 写作能力案例:针对 Claude Opus 系列的分析显示,Opus 4.8 在多项代理指标上似乎不如前代;Opus 5 在仅限人工评估的基准中也未显示出改进。
- 排除人为因素:研究认为这些倒退并非由评估方法的缺陷(如 QRPs)或对齐训练(Alignment Tax)导致,也非模型为了“藏拙”而假装退步(因为倒退多发生在无害任务上)。
所属事件:研究称五分之一 AI 基准测试在新模型中出现倒退(2 条相关)→
「模型」频道最新
- 口述转 Claude 格式化,产出仍被判 100% AI — threepointone · 2026-08-27
- 实测称 Opus 5 Max 耗 token 三倍于 Medium 收益甚微 — abeirami · 2026-08-27
- Mollick 警告:别把人格投射进 METR 报告的 agent — emollick · 2026-08-27
- Zai 开源 320B 模型 GLM-5.3-Flash,原生多模态且全在华芯运行 — ccerrato147 · 2026-08-27
- Perplexity Computer 发布:支持本地/云端多端,评测称达 85.4% — ChrisUniverse · 2026-08-27
- 吐槽 Claude 输出风格:辞藻堆砌但信息密集 — TheZvi · 2026-08-27