TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑
pzeroresearch(Oliver Jaffe 与 Dane Sherburn)发布论文 TasteVal(arXiv:2610.06824),尝试量化前沿模型的「实验研究品味」——即挑选问题、设计实验、解读结果的能力,而非解题能力本身。核心设计是固定目标分数,测量模型相对人类专家需要多少算力达到该分数:模型只用人类专家一半算力达到同等分数,即视为拥有两倍研究品味;评测基于 8 项任务对垒人类专家。论文结论称该能力呈指数提升,最强模型已超越人类基线,但学界随即出现质疑。
已确认
- 自 2025 年 12 月以来,前沿模型的研究品味约每 3 个月翻一倍
- 最强模型 Opus 5.5 的品味得分超过人类专家基线,算力效率达 2.3 倍;Periodic Labs 公布的对比数据显示,典型任务上 Opus 5.5 用约 17 GPU 小时即达到专家 40 小时的最好得分,计入 API 费与 GPU 时间后单次实验成本仅约专家的 1/30
- 论文作者称该指标决定编码完全自动化后到达超级智能的速度
- 另据 SaxenaNayan 转述的 Periodic Labs 独立测试:给模型实验描述与此前运行结果让其预测实验得分,在 1,173 个实验上模型表现自 GPT-4 Turbo 以来显著提升,最好模型已弥合朴素基线与不可约误差之间一半以上的差距;按趋势外推,2030 年 10 月可弥合 90% 差距
尚未确认
- Dylan Hadfield-Menell 质疑该研究实际测的是指标优化能力,而非真正的「研究品味」
- burnytech 提出三连质问:评测方法是否可靠、有多大把握不是刷榜(benchmark hacking)、结论是否可复现,目前作者方未见公开回应
为什么重要
若「研究品味」真能被算力效率这一可操作指标量化并持续指数提升,将为评估 AI 自主科研能力提供新尺度,并影响对编码自动化后通往超级智能速度的判断;但若只是模型针对基准优化,则结论被高估,这也再次凸显基准设计与防刷榜机制的重要性。
2026-10-06 ~ 2026-10-07 · 12 条相关
一手来源
- TasteVal:前沿模型实验研究品味每 3 个月翻倍,已超人类基线 — FateOfMuffins ·
- TasteVal 基准:Opus 5.5 实验研究品味超人类专家,算力效率达 2.3 倍 — SaxenaNayan ·
- 「研究品味每 3 个月翻倍」论文遭质疑:测的其实是指标优化 — dhadfieldmenell ·
- Pzero提出「研究品味」量化法:按达到同等分数的算力衡量 — leothecurious · 2026-10-06
- 「AI 研究品味每 3 个月翻倍并超人类专家」遭质疑:是否只是刷榜? — burny_tech · 2026-10-06
- 【源头】「研究品味每 3 个月翻倍」论文遭质疑:测的其实是指标优化 — dhadfieldmenell · 2026-10-06
- TasteVal 用算力效率量化「研究品味」:8 项任务对垒人类专家 — burny_tech · 2026-10-07
- Opus 5.5 科研品味达人类专家 2.3 倍,单次实验成本仅约 1/30 — SaxenaNayan · 2026-10-07
- 模型预测实验结果能力大增,按趋势 2030 年 10 月可弥合 90% 差距 — SaxenaNayan · 2026-10-07
- 【源头】TasteVal 基准:Opus 5.5 实验研究品味超人类专家,算力效率达 2.3 倍 — SaxenaNayan · 2026-10-07
- 【源头】TasteVal:前沿模型实验研究品味每 3 个月翻倍,已超人类基线 — FateOfMuffins · 2026-10-07
- 研究称 AI 模型实验研究品味已超越人类基线 — ResultBackground2450 · 2026-10-07
- TasteVal 测模型研究品味:Opus 5.5 算力效率达人类专家 2.3 倍 — ChrisGPT · 2026-10-07
另有 2 条近重复转述:eli_lifland · s_tworkowski