CMU 发布 WhatWorkedBench:测 AI 研究智能体的实验理解能力

CarnegieMellonU · hf · 2026-09-24

CMU 团队推出 WhatWorkedBench,衡量 AI 研究智能体的「实验理解」能力——即在有限预算实验后,准确预测组件改动对结果影响的能力。智能体需查看代码、选择测量项并提交响应面表格,预测每种组件配置下的得分;全量 CPU 执行提供控制变量下的参考效应。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →