AI研究品味每3个月翻倍说法遭质疑被指只是刷榜
P-Zero Research 发布研究称,前沿模型的「实验研究品味」自 2025 年 12 月起每约 3 个月翻一倍,最强模型 Opus 5.5 已超过其专家人类基线,并表示该指标具有重要意义。然而该结论很快遭到质疑,burnytech 提出三连质问,认为模型表现的提升可能只是针对指标的优化即「刷榜」,测的并非真正的研究品味,相关争议仍在发酵。
2026-10-06 ~ 2026-10-06 · 2 条相关
- 「AI 研究品味每 3 个月翻倍并超人类专家」遭质疑:是否只是刷榜? — burny_tech · 2026-10-06
- 「研究品味每 3 个月翻倍」论文遭质疑:测的其实是指标优化 — dhadfieldmenell · 2026-10-06