AI研究品味每3个月翻倍说法遭质疑被指只是刷榜

P-Zero Research 发布研究称,前沿模型的「实验研究品味」自 2025 年 12 月起每约 3 个月翻一倍,最强模型 Opus 5.5 已超过其专家人类基线,并表示该指标具有重要意义。然而该结论很快遭到质疑,burnytech 提出三连质问,认为模型表现的提升可能只是针对指标的优化即「刷榜」,测的并非真正的研究品味,相关争议仍在发酵。

2026-10-06 ~ 2026-10-06 · 2 条相关