TasteVal 用算力效率量化「研究品味」:8 项任务对垒人类专家
burny_tech · x · 2026-10-07
新基准 TasteVal 尝试把 AI 研究中的「实验品味」(research taste)可操作化:用达到给定分数所需实验算力相对人类专家的比值来衡量——模型用一半算力达到专家水平,即拥有两倍研究品味。
要点:
- TasteVal 包含 8 项代表性前沿 AI 研发任务:预训练数据筛选、语言模型预训练与微调、偏好建模、对抗 prompt 鲁棒性。
- 为隔离品味与编码能力,被测模型只负责设计实验与解读结果,由固定 coding agent 在单张 H100 上执行。
讨论中对评测有效性提出质疑:如何评估、是否会被 benchmaxx、多少任务是固定目标 vs 开放式问题(验证信号更模糊)。作者承认这是 proxy 的尝试,至少好过纯 vibes。
「研究」频道最新
- AI 数学证明走向开源式协作:方格装箱证明附可视化讲解 — ctjlewis · 2026-10-07
- 开源平台 Overmind:用生产轨迹持续训练与改进 AI Agent — cneuralnetwork · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07
- AutoAWQ 作者:约 4.3 万美元和一个 B300 节点四周可复现 Bonsai 2 — airesearch12 · 2026-10-07
- COLM 2026 新研究:下游任务早接触统一安全预训练视角 — AdtRaghunathan · 2026-10-07
- SWE Decision Index v0.3 发布:私有关卡+视觉评测防刷榜 — multimodalart · 2026-10-07