TasteVal 用算力效率量化「研究品味」:8 项任务对垒人类专家

burny_tech · x · 2026-10-07

新基准 TasteVal 尝试把 AI 研究中的「实验品味」(research taste)可操作化:用达到给定分数所需实验算力相对人类专家的比值来衡量——模型用一半算力达到专家水平,即拥有两倍研究品味。

要点:

讨论中对评测有效性提出质疑:如何评估、是否会被 benchmaxx、多少任务是固定目标 vs 开放式问题(验证信号更模糊)。作者承认这是 proxy 的尝试,至少好过纯 vibes。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →