专题 · FULL STORY
TasteVal风波:AI研究品味如何量化之争
pzeroresearch 发布论文 TasteVal,宣称 AI 研究品味每三个月翻倍并已超越人类专家,随即遭到学界质疑。随后 ML 社区围绕「什么是研究品味」展开多回合激辩,定义与基准之争持续发酵。
2026-10-06 ~ 2026-10-07 · 2 集 · 23 条
第 1 集 · TasteVal 称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(2026-10-06,17 条)
pzeroresearch(Oliver Jaffe 与 Dane Sherburn)发布论文 TasteVal(arXiv:2610.06824),尝试量化前沿模型的「实验研究品味」——即挑选问题、设计实验、解读结果的能力,而非解题能力本身。论文称该能力自 2025 年 12 月以来约每 3 个月翻倍,最强模型 Opus 5.5 已超过人类专家基线,但随即遭到学界质疑。
已确认
- 核心设计是固定目标分数,测量模型相对人类专家需要多少算力达到该分数:模型只用人类专家一半算力达到同等分数,即视为拥有两倍研究品味;评测基于 8 项任务对垒人类专家
- 自 2025 年 12 月以来,前沿模型的研究品味约每 3 个月翻一倍
- 最强模型 Opus 5.5 的品味得分超过人类专家基线,算力效率达 2.3 倍;Periodic Labs 公布的对比数据显示,典型任务上 Opus 5.5 用约 17 GPU 小时即达到专家 40 小时的最好得分,计入 API 费与 GPU 时间后单次实验成本仅约专家的 1/30
- 论文作者称该指标决定编码完全自动化后到达超级智能的速度
- 另据 SaxenaNayan 转述的 Periodic Labs 独立测试:给模型实验描述与此前运行结果让其预测实验得分,在 1,173 个实验上模型表现自 GPT-4 Turbo 以来显著提升,最好模型已弥合朴素基线与不可约误差之间一半以上的差距;按趋势外推,2030 年 10 月可弥合 90% 差距
尚未确认
- Dylan Hadfield-Menell 质疑该研究实际测的是指标优化能力,而非真正的「研究品味」;AsafBenj 亦吐槽读论文后发现测的只是「指标爬山」,并指出 ML 圈常把「研究品味」偷换成对下一步爬升指标的直觉,与科学家意义上的品味不同,还质疑这能否支撑危险的递归自我改进
- burnytech 提出三连质问:评测方法是否可靠、有多大把握不是刷榜(benchmark hacking)、结论是否可复现,目前作者方未见公开回应
为什么重要
若「研究品味」真能被算力效率这一可操作指标量化并持续指数提升,将为评估 AI 自主科研能力提供新尺度,并影响对编码自动化后通往超级智能速度的判断;但若只是模型针对基准优化,则结论被高估,这也再次凸显基准设计与防刷榜机制的重要性。
- Pzero提出「研究品味」量化法:按达到同等分数的算力衡量 — leothecurious · 2026-10-06
- 「AI 研究品味每 3 个月翻倍并超人类专家」遭质疑:是否只是刷榜? — burny_tech · 2026-10-06
- 「研究品味每 3 个月翻倍」论文遭质疑:测的其实是指标优化 — dhadfieldmenell · 2026-10-06
- TasteVal 用算力效率量化「研究品味」:8 项任务对垒人类专家 — burny_tech · 2026-10-07
- Opus 5.5 科研品味达人类专家 2.3 倍,单次实验成本仅约 1/30 — SaxenaNayan · 2026-10-07
- 模型预测实验结果能力大增,按趋势 2030 年 10 月可弥合 90% 差距 — SaxenaNayan · 2026-10-07
- TasteVal 基准:Opus 5.5 实验研究品味超人类专家,算力效率达 2.3 倍 — SaxenaNayan · 2026-10-07
- TasteVal:前沿模型实验研究品味每 3 个月翻倍,已超人类基线 — FateOfMuffins · 2026-10-07
- 研究称 AI 模型实验研究品味已超越人类基线 — ResultBackground2450 · 2026-10-07
- 研究:前沿模型「研究品味」约每 3 个月翻倍,Opus 5.5 超人类专家基线 — eli_lifland · 2026-10-07
- 前沿模型「研究品味」每约 3 个月翻倍,Opus 5.5 已超人类专家基线 — s_tworkowski · 2026-10-07
- TasteVal 测模型研究品味:Opus 5.5 算力效率达人类专家 2.3 倍 — ChrisGPT · 2026-10-07
- 前沿模型「研究品味」每3个月翻倍,已超人类专家基线 — coherence · 2026-10-07
- ML 圈把「研究品味」偷换成爬山直觉,够不够支撑危险 RSI? — AsafBenj · 2026-10-07
- 评测称前沿模型实验设计品味每3个月翻倍,已超专家级AI研究员 — Puzzleheaded-King584 · 2026-10-07
- 报告:前沿模型实验设计品味每 3 个月翻倍,已超专家 — Puzzleheaded-King584 · 2026-10-07
- 研究:前沿模型「实验研究品味」每约 3 个月翻倍,Opus 5.5 已超人类专家 — ZeroStateReflex · 2026-10-07
第 2 集 · 什么是「研究品味」?ML 圈隔空激辩定义与基准(2026-10-07,6 条)
10 月 7 日,ML 研究社区围绕「什么是研究品味」爆发了一场多回合争论,起因是 pzeroresearch 发布的 AI「research taste」相关成果与基准,引发多位研究者对用词准确性的质疑。
已确认
- Dimitris Papailiopoulos(UW 教授、前 OpenAI 研究员)在被问「什么是好品味」时表示,这如同解释「什么成就一本好书或一首好诗」一样难:任何一组近似指标都能构造出满足全部指标却缺乏品味的反例;若品味无法被指标化,这对人类反而是好消息。
- leothecurious 提出,品味可近似表示为「相对于产出的努力效率」;Papailiopoulos 对此定义直呼「那不是品味」。
- anpaure 质疑 pzeroresearch 宣称的 AI「research taste」实为短视野的 autoresearch hillclimbing,并以 nanogpt 为例:社区已在上面烧掉数以万计的 GPU 算力,却仍错过一些简单建议。
- David Hadfield-Menell(伯克利教授)回应 Asaf Benj 关于「研究品味」基准的争论:他承认该基准衡量了对「AI→AI 研发」反馈循环很重要的能力,但基准实际测的是「对指标爬山」的直觉,而非真正的品味;他进一步明确表态,把品味重新定义为「对既定问题如何最佳求解的直觉」的人就是错了,愿意为这个观点战斗到底。
- Papailiopoulos 还在讨论中吐槽:如今模型的写作风格与 GPT-4 时期如出一辙甚至更差,「写作品味」上几乎零提升,而品味本身又难以验证。
为什么重要
这场争论的核心并不只是语义之争:如果「品味」确实无法被指标化,那么以爬山式指标衡量的 AI 研发能力与人类研究者不可替代的判断力之间就存在本质差异——这既是 Papailiopoulos 所说的「对人类的好消息」,也直接关系到「AI→AI 研发」反馈循环能在多大程度上真正替代人类科研直觉。用词之争背后,是对当前 AI 自动研究能力边界的分歧。
- 什么是研究者的「品味」?两位 ML 研究者隔空争论定义 — leothecurious · 2026-10-07
- 前 OpenAI 研究员:品味像好诗一样难定义,这对人类是好消息 — DimitrisPapail · 2026-10-07
- 研究者吐槽:模型写作水平较 GPT-4 几乎零提升,品味无法验证 — DimitrisPapail · 2026-10-07
- 质疑 AI「研究品味」:数万 GPU 时 hillclimbing 仍错过简单建议 — anpaure · 2026-10-07
- Hadfield-Menell:新基准测的是爬山能力,不是「研究品味」 — dhadfieldmenell · 2026-10-07
- Hadfield-Menell 硬刚:把品味重定义为解题直觉的人就是错了 — dhadfieldmenell · 2026-10-07