HarnessEval发布:评测从Metric进化为可执行系统
机器之心 · wechat · 2026-08-18
评测范式的系统化升级
MirroS联合清华、北大、伯克利、MIT等机构发布HarnessEval,主张将评测从静态Metric升级为可执行的Agent评测系统(Evaluation Harness)。
核心变化:
- 从规则到工作流:不再是运行预设脚本,而是让评测Agent理解案例,动态规划评测路径,选择并组合技能。
- 四大阶段:
- Plan:理解案例与意图。
- Route:从技能库路由选择适用技能。
- Decompose:将抽象问题拆解为可验证的子问题。
- Verify:审计证据,输出分数。
应用落地:首发于交互式世界模型评测(HarnessEval-W)。针对视频生成中的物理一致性、因果顺序等复杂问题,系统能生成层级化的证据树,定位错误来源而非仅给出标量分数。
意义:支持RSI(递归式自我改进),评测不再是外部尺子,而是系统进化闭环中的关键反馈组件。
所属事件:HarnessEval 开源框架将基准测试升级为智能代理工作流(4 条相关)→
「研究」频道最新
- 音频水印科普长文:AI 音乐时代的所有权与反水印博弈 — TheChuckTone · 2026-08-19
- 黑客 10 分钟让 Agent 自残泄密:改个“节日”就shutdown — socialwithaayan · 2026-08-19
- SIGGRAPH 2025:Meta 开源单目 3D 高斯在线重建库 — rsasaki0109 · 2026-08-19
- David Bau 征集建议:哪些深度学习论文是必读经典? — davidbau · 2026-08-19
- DiSCO:利用提示词优化防御文生图有害内容 — kaust-generative-ai · 2026-08-19
- 新论文提出“智能每瓦”指标,衡量本地 AI 效率 — pscoutou · 2026-08-19