「研究品味每 3 个月翻倍」论文遭质疑:测的其实是指标优化
dhadfieldmenell · x · 2026-10-06
pzeroresearch 发布研究称,前沿模型的「实验研究品味」自 2025 年 12 月以来每约 3 个月翻倍,最强模型 Opus 5.5 已超过其专家人类基线,并称该指标决定编码完全自动化后到达超级智能的速度。
但 Hadfield-Menell 用 green-text 形式提出尖锐批评:
- 评测声称衡量的是「研究品味」,但读论文后发现它测的是「指标优化」——即沿单一指标爬山,而非真正的研究判断力
- 他画图区分「品味」与「指标爬山」两个概念,但作者团队没能理解这种质疑,反而回应称「这是个好评测」
- 这篇帖子在 AI 评测圈引发关于「模型评测是否在测它宣称测的东西」的争论
所属事件:AI研究品味每3个月翻倍说法遭质疑被指只是刷榜(2 条相关)→
「漫话AGI」频道最新
- Gary Marcus 对谈:OpenAI 偷偷外挂工具,让公众误以为 LLM 本身擅长数学 — Dave_it_up · 2026-10-06
- 为何总回到 Benedict Evans:'久而久之,我们改变工作方式去适应工具' — _AustinCalvert_ · 2026-10-06
- 作者预测'模型福利'倡导将泛滥:非因技术突破,而是人设被做得更像人 — alexisgallagher · 2026-10-06
- 硅谷热议:资本现实主义与延续主义没有区别,Musk 被指数十年倒向此论 — DavidDuvenaud · 2026-10-06
- 卫报批 Altman:收益私有化、风险社会化 — nordicinst · 2026-10-06
- 模型欺骗是愿望不连贯的产物:我们在自欺而非被 AI 骗 — aiamblichus · 2026-10-06