开源 HarnessEval-W:世界模型的 Agentic 评测新范式

青稞AI · wechat · 2026-08-21

MirroS 团队开源了 HarnessEval-W,一种针对世界模型的 Agentic Benchmark。该系统引入 Harness 框架,将人类评测流程自动化,通过主智能体动态调度专业子智能体和工具,从观测质量、状态转移正确性和世界持续性三个维度进行评测。它不仅输出分数,更生成可追溯的证据树,帮助定位模型错误。团队还介绍了利用 Agent 构建评测数据的流程,并展望了测试时扩展、技能库扩展及自回归改进等未来方向。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →