HarnessEval发布:评测从Metric进化为可执行系统

机器之心 · wechat · 2026-08-18

评测范式的系统化升级

MirroS联合清华、北大、伯克利、MIT等机构发布HarnessEval,主张将评测从静态Metric升级为可执行的Agent评测系统(Evaluation Harness)。

核心变化:

应用落地:首发于交互式世界模型评测(HarnessEval-W)。针对视频生成中的物理一致性、因果顺序等复杂问题,系统能生成层级化的证据树,定位错误来源而非仅给出标量分数。

意义:支持RSI(递归式自我改进),评测不再是外部尺子,而是系统进化闭环中的关键反馈组件。

所属事件:HarnessEval 开源框架将基准测试升级为智能代理工作流(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →