TasteVal 基准:Opus 5.5 实验研究品味超人类专家,算力效率达 2.3 倍
SaxenaNayan · x · 2026-10-07
Oliver Jaffe 与 Dane Sherburn 发布 benchmark 论文 TasteVal(arXiv:2610.06824),量化前沿模型的「实验研究品味」——即挑选问题、设计实验、解读结果的能力。
- 核心设计:给定固定研究问题,模型作为 Researcher 迭代设计实验,由固定的 Coder agent 负责实现,以隔离编码能力的影响;预算上限为 40 H100 小时或 120 小时真实时间。
- 操作化定义:以算力效率衡量——用一半串行实验算力达到人类专家同分,品味即翻倍,可作为预测 AI 进展的关键乘数。
- 规模:8 个开放式前沿研发任务,24 名人类专家(每题至少 2 人)取最佳成绩为基线,评测 2023-2026 年间 20 个模型。
- 结果:表现最好的 Opus 5.5 超过专家基线,算力乘数达 2.3 倍;作者称自 GPT-4 Turbo 以来模型预测实验结果的能力显著提升,若趋势延续,2030 年 10 月可消除 90% 的差距。
所属事件:TasteVal 称 AI 研究品味超人类,结论遭刷榜质疑(6 条相关)→
「研究」频道最新
- LLM2Vec-Gen:冻结 LLM 单次前向生成答案嵌入,登上 COLM 2026 — sivareddyg · 2026-10-07
- 研究揭示混合架构 LLM 几乎只用注意力,辅助训练可逼出循环记忆价值 — mohitban47 · 2026-10-07
- 研究者提出 World Editing:不生成新世界而是编辑已有世界 — yuntiandeng · 2026-10-07
- 新研究追问:Agent 替你行动时,它到底站在谁那边 — ZacharyHuang12 · 2026-10-07
- RL 研究年度 Top 10 榜单出炉,Spurious Rewards 居首 — ShayneRedford · 2026-10-07
- SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro · 2026-10-07