专题 · FULL STORY

TasteVal风波:AI研究品味如何量化之争

pzeroresearch 发布论文 TasteVal,宣称 AI 研究品味每三个月翻倍并已超越人类专家,随即遭到学界质疑。随后 ML 社区围绕「什么是研究品味」展开多回合激辩,定义与基准之争持续发酵。

2026-10-06 ~ 2026-10-07 · 2 集 · 23 条

第 1 集 · TasteVal 称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(2026-10-06,17 条)

pzeroresearch(Oliver Jaffe 与 Dane Sherburn)发布论文 TasteVal(arXiv:2610.06824),尝试量化前沿模型的「实验研究品味」——即挑选问题、设计实验、解读结果的能力,而非解题能力本身。论文称该能力自 2025 年 12 月以来约每 3 个月翻倍,最强模型 Opus 5.5 已超过人类专家基线,但随即遭到学界质疑。

已确认

  • 核心设计是固定目标分数,测量模型相对人类专家需要多少算力达到该分数:模型只用人类专家一半算力达到同等分数,即视为拥有两倍研究品味;评测基于 8 项任务对垒人类专家
  • 自 2025 年 12 月以来,前沿模型的研究品味约每 3 个月翻一倍
  • 最强模型 Opus 5.5 的品味得分超过人类专家基线,算力效率达 2.3 倍;Periodic Labs 公布的对比数据显示,典型任务上 Opus 5.5 用约 17 GPU 小时即达到专家 40 小时的最好得分,计入 API 费与 GPU 时间后单次实验成本仅约专家的 1/30
  • 论文作者称该指标决定编码完全自动化后到达超级智能的速度
  • 另据 SaxenaNayan 转述的 Periodic Labs 独立测试:给模型实验描述与此前运行结果让其预测实验得分,在 1,173 个实验上模型表现自 GPT-4 Turbo 以来显著提升,最好模型已弥合朴素基线与不可约误差之间一半以上的差距;按趋势外推,2030 年 10 月可弥合 90% 差距

尚未确认

  • Dylan Hadfield-Menell 质疑该研究实际测的是指标优化能力,而非真正的「研究品味」;AsafBenj 亦吐槽读论文后发现测的只是「指标爬山」,并指出 ML 圈常把「研究品味」偷换成对下一步爬升指标的直觉,与科学家意义上的品味不同,还质疑这能否支撑危险的递归自我改进
  • burnytech 提出三连质问:评测方法是否可靠、有多大把握不是刷榜(benchmark hacking)、结论是否可复现,目前作者方未见公开回应

为什么重要

若「研究品味」真能被算力效率这一可操作指标量化并持续指数提升,将为评估 AI 自主科研能力提供新尺度,并影响对编码自动化后通往超级智能速度的判断;但若只是模型针对基准优化,则结论被高估,这也再次凸显基准设计与防刷榜机制的重要性。

第 2 集 · 什么是「研究品味」?ML 圈隔空激辩定义与基准(2026-10-07,6 条)

10 月 7 日,ML 研究社区围绕「什么是研究品味」爆发了一场多回合争论,起因是 pzeroresearch 发布的 AI「research taste」相关成果与基准,引发多位研究者对用词准确性的质疑。

已确认

  • Dimitris Papailiopoulos(UW 教授、前 OpenAI 研究员)在被问「什么是好品味」时表示,这如同解释「什么成就一本好书或一首好诗」一样难:任何一组近似指标都能构造出满足全部指标却缺乏品味的反例;若品味无法被指标化,这对人类反而是好消息。
  • leothecurious 提出,品味可近似表示为「相对于产出的努力效率」;Papailiopoulos 对此定义直呼「那不是品味」。
  • anpaure 质疑 pzeroresearch 宣称的 AI「research taste」实为短视野的 autoresearch hillclimbing,并以 nanogpt 为例:社区已在上面烧掉数以万计的 GPU 算力,却仍错过一些简单建议。
  • David Hadfield-Menell(伯克利教授)回应 Asaf Benj 关于「研究品味」基准的争论:他承认该基准衡量了对「AI→AI 研发」反馈循环很重要的能力,但基准实际测的是「对指标爬山」的直觉,而非真正的品味;他进一步明确表态,把品味重新定义为「对既定问题如何最佳求解的直觉」的人就是错了,愿意为这个观点战斗到底。
  • Papailiopoulos 还在讨论中吐槽:如今模型的写作风格与 GPT-4 时期如出一辙甚至更差,「写作品味」上几乎零提升,而品味本身又难以验证。

为什么重要

这场争论的核心并不只是语义之争:如果「品味」确实无法被指标化,那么以爬山式指标衡量的 AI 研发能力与人类研究者不可替代的判断力之间就存在本质差异——这既是 Papailiopoulos 所说的「对人类的好消息」,也直接关系到「AI→AI 研发」反馈循环能在多大程度上真正替代人类科研直觉。用词之争背后,是对当前 AI 自动研究能力边界的分歧。