TasteVal Claims AI Research Taste Now Beats Humans, Drawing Benchmark-Gaming Skepticism
P-Zero Research 发布新基准 TasteVal(论文 arXiv:2610.06824,作者含 Oliver Jaffe 与 Dane Sherburn),宣称前沿 AI 模型的「实验研究品味」已超过人类专家,且该能力自 2025 年 12 月以来约每 3 个月翻一倍。结论随即在社区引发质疑。
已确认
- TasteVal 评测对象是模型挑选有价值研究方向、设计实验、解读结果的能力,而非解题能力本身。
- 评测方法将「品味」可操作化:用达到给定分数所需实验算力相对人类专家的比值来衡量,模型若用一半算力达到专家水平即视为两倍研究品味;基准包含 8 项任务,与人类专家对垒。
- 研究称最强模型 Opus 5.5 的品味得分已超过人类专家基线,算力效率达 2.3 倍;前沿模型该能力约每 3 个月翻倍。
- 研究方称该指标关系到编码完全自动化后到达超级智能的速度。
尚未确认
- Dylan Hadfield-Menell 质疑该论文实际测量的可能是「指标优化」而非真正的研究品味。
- burnytech 提出三连质问:结论如何评测、多大把握不是刷榜(benchmark gaming)等,暗示结论可能是模型针对基准优化所致。
为什么重要
- 若研究品味确如所述指数提升,将是判断 AI 走向自主科研乃至超级智能速度的关键信号;但若评测可被刷榜,结论需打折扣。围绕该基准的争议本身也折射出社区对「AI 能力评测是否可靠」的持续担忧。
2026-10-06 ~ 2026-10-07 · 6 related posts
Primary sources
- TasteVal benchmark finds Opus 5.5 beats human experts at research taste with 2.3x compute multiplier — SaxenaNayan ·
- Critic Calls Out 'Research Taste Doubles Every 3 Months' Eval as Merely Metric Optimization — dhadfieldmenell ·
- AI Models Now Outperform Humans at Experimental Research Taste, Says TasteVal — ResultBackground2450 ·
- Researcher challenges claim that AI research taste doubles every 3 months — burny_tech · 2026-10-06
- [source] Critic Calls Out 'Research Taste Doubles Every 3 Months' Eval as Merely Metric Optimization — dhadfieldmenell · 2026-10-06
- TasteVal Quantifies AI 'Research Taste' as Compute Efficiency Across 8 Frontier R&D Tasks — burny_tech · 2026-10-07
- [source] TasteVal benchmark finds Opus 5.5 beats human experts at research taste with 2.3x compute multiplier — SaxenaNayan · 2026-10-07
- TasteVal: Frontier AI Research Taste Doubles Every 3 Months, Now Exceeds Humans — FateOfMuffins · 2026-10-07
- [source] AI Models Now Outperform Humans at Experimental Research Taste, Says TasteVal — ResultBackground2450 · 2026-10-07