TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑

pzeroresearch(Oliver Jaffe 与 Dane Sherburn)发布论文 TasteVal(arXiv:2610.06824),尝试量化前沿模型的「实验研究品味」——即挑选问题、设计实验、解读结果的能力,而非解题能力本身。核心设计是固定目标分数,测量模型相对人类专家需要多少算力达到该分数:模型只用人类专家一半算力达到同等分数,即视为拥有两倍研究品味;评测基于 8 项任务对垒人类专家。论文结论称该能力呈指数提升,最强模型已超越人类基线,但学界随即出现质疑。

已确认

尚未确认

为什么重要

若「研究品味」真能被算力效率这一可操作指标量化并持续指数提升,将为评估 AI 自主科研能力提供新尺度,并影响对编码自动化后通往超级智能速度的判断;但若只是模型针对基准优化,则结论被高估,这也再次凸显基准设计与防刷榜机制的重要性。

2026-10-06 ~ 2026-10-07 · 12 条相关

一手来源

另有 2 条近重复转述:eli_lifland · s_tworkowski