HarnessEval 发布:将基准测试转化为智能代理工作流

ziqi_huang_ · x · 2026-08-19

MirroSai 发布了开源评测框架 HarnessEval,旨在将传统的静态基准测试转化为动态的智能代理工作流。该框架利用代理主动解释上下文,将高层评估问题分解为子问题,并调用工具生成子代理,以精准定位模型失败原因并输出可验证的推理轨迹。首个针对视觉生成世界模型的代理评测基准 HarnessEval-W 已随代码、技能库和案例一同开源。

所属事件:HarnessEval 开源框架将基准测试升级为智能代理工作流(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →