CMU 发布 WhatWorkedBench:测 AI 研究智能体的实验理解能力
CarnegieMellonU · hf · 2026-09-24
CMU 团队推出 WhatWorkedBench,衡量 AI 研究智能体的「实验理解」能力——即在有限预算实验后,准确预测组件改动对结果影响的能力。智能体需查看代码、选择测量项并提交响应面表格,预测每种组件配置下的得分;全量 CPU 执行提供控制变量下的参考效应。
- 覆盖 36 个任务、30 个数据源、8 类工作流,共 1248 条配置记录;核心评测含 4206 条数值控制记录与 108 条智能体回合
- 仅 8 次新测量时,配对效应 ridge 回归在 22 个数据源中的 15 个选出最优配置
- 对同样观测拟合高斯过程可将效应恢复度从 0.632 提至 0.698;编码代码等价性将 GP 恢复度从 0.248 提至 0.462
- 面向实验智能体、自适应实验设计、数值推断等研究方向
「编程与Agent」频道最新
- 用一段 Hermes Agent 提示词让 Claude 自审记忆文件防膨胀 — alexcovo_eth · 2026-09-24
- 开源 MCP 服务器打通 Claude 与 ComfyUI,50+ 工具免拖节点 — Less_Actuary_9441 · 2026-09-24
- 用 Notion 做数据中枢:AI 服务随时换、数据不搬家 — ivanhzhao · 2026-09-24
- 开发者激辩:会用编程 Agent 的 22 岁胜过守旧资深工程师 — jobergum · 2026-09-24
- Blender MCP 星标 2.9 万,Opus 5.5 中档力度即可建城 — sidahuj · 2026-09-24
- AI 蜂群两周逆向 2001 年 GBA 游戏,逐字节完全复刻 ROM — Aizkmusic · 2026-09-24