开源 HarnessEval-W:世界模型的 Agentic 评测新范式
青稞AI · wechat · 2026-08-21
MirroS 团队开源了 HarnessEval-W,一种针对世界模型的 Agentic Benchmark。该系统引入 Harness 框架,将人类评测流程自动化,通过主智能体动态调度专业子智能体和工具,从观测质量、状态转移正确性和世界持续性三个维度进行评测。它不仅输出分数,更生成可追溯的证据树,帮助定位模型错误。团队还介绍了利用 Agent 构建评测数据的流程,并展望了测试时扩展、技能库扩展及自回归改进等未来方向。
「研究」频道最新
- 区分多智能体三种定义:编排、蜂群与仿真系统 — sebkrier · 2026-08-21
- 康奈尔新架构降低 36% 训练算力 — burkov · 2026-08-21
- SkillEvo:利用多轮反馈实现智能体技能持续进化 — zju · 2026-08-21
- ShikharMurty:Pass@k 上升不代表模型学到新东西 — ShikharMurty · 2026-08-21
- 商汤 SenseNova U1.5-Lite 发布:专家训练+OPD 蒸馏 — SandyL925 · 2026-08-21
- 生信工具 FasterFASTA:多线程解压提速明显 — viglovikov · 2026-08-21