世界模型评测 agent 化:18 个模型 330 案例的打分背后是一棵可审计的证据树

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

cs.CV

2026-08-18

把 LLM 生态的 evaluation harness 范式搬进世界模型评测:agent 按案例路由技能、拆子问题、派子代理取证,对 18 个模型 330 个 rollout 打分,与人类 A/B 偏好秩相关 0.87~0.93,比 WBench 协议的成对判对率高出 10~40 个点。

这篇在解决什么

视频生成圈这两年最头疼的事,是「分数解释不了」。VBench、WorldScore 这类榜单给世界模型(world model,即根据历史画面和动作预测未来观测的交互式生成模型)打分,靠的是固定指标或者一次性 LLM 判官,输出一个标量。至于机器人右手夹起的到底是哪把勺子、画面里有没有多出一只不该出现的手,分数一个字不提。评测本身没有推理链,既不能验证,也定位不了失败在哪。

作者把这归因于评测范式问题:人类看一段 rollout,会先定位物体、跟踪物体恒常性、再核对因果关系,这是一个工作流;而现有 benchmark 把它压成了一次静态打分。LLM 生态早就用 evaluation harness 把这类工作流工程化了,视觉世界模型这边还是空白。

方法

HarnessEval-W 的核心是把「评测」拆成三层 agent 流水线:

评测轴从世界模型的形式化分解导出:观测质量(S,渲染当前状态)、状态转移正确性(T,动作是否被忠实执行)、世界持续性(状态序列是否长期连贯),共 8 个细粒度设置。案例本身也用 agent 流水线构造:场景分类树采样世界、图像生成器出初始图、图像接地的规划器下动作、独立校验 agent 审核不过关就重采,最终落成 330 个案例。所有子代理用同一个 VLM 后端、同温度同帧采样。

结果

18 个模型(通用视频生成器、原生动作控制、相机位姿控制三类)在 330 个案例上同题同卷:

模型接口总分
Seedance 2.0文本指令75.5
Wan 2.7文本指令75.0
Kling 3.0文本指令74.4
SANA-WM原生动作68.7(屏外演化单项第一 72.3)
HY-WorldPlay 1.5相机位姿67.1(重访一致性单项第一 81.9)

评测器本身的三项校验更关键:

对比指标HarnessEval-WWBench 协议
物理与因果成对判对率71.7%31.9%
物理与因果平局率1.8%52.2%
意图与事件编辑成对判对率77.8%60.2%

与 5000 次人类 A/B 判断拟合的 Bradley-Terry 强度对齐,Spearman 秩相关 0.93(意图转移)/ 0.87(物理转移)。温度 0 重跑三轮,拟合曲线包络只有 WBench 的五分之一宽,打分稳定。同一 GPT-5.5 后端、同帧采样,唯一变量是评测协议本身。

两个附带发现值得单说。其一,意图转移和物理转移相关系数高达 0.98,探索式转移却和它们几乎无关(-0.15 / -0.18):能把画面续得连贯,不代表听得懂指令。其二,把文生视频模型微调成动作条件模型,能力是被重新分配而非整体提升:Wan 2.2 到 DreamX-World,探索 +4.8、重访 +7.8,意图转移 -11.9、物理 -7.2;HunyuanVideo 1.5 到 HY-WorldPlay 1.5 更极端,重访 +8.4 换意图 -24.2。

为什么重要

对做世界模型的人,这给了一个能定位失败模式的评测:低分可以回溯到具体子问题(目标打错了、多了无关事件、最终状态没到位),而不是只看到数字掉了。对评测方法圈,这是 harness 范式向视觉生成领域的第一次完整移植,且开源成可扩展技能库的活 benchmark。

微调那组数据对选型有直接参考:如果你的应用需要精确执行指令(机器人仿真、交互式编辑),通用视频生成器目前仍强于专门的交互式世界模型,后者在探索和长程一致性上花掉的能力是从指令遵循里挪出来的。

局限与存疑

评测器上限被 VLM 后端封顶:子代理全部用同一个 VLM,画面里 VLM 自己看走眼的(细粒度形变、快速运动),证据树写得再清楚也救不回来。18 个模型的横向对比是各自用官方 checkpoint 和原生条件接口,接口差异(文本指令 vs 相机轨迹 vs 动作序列)对分数的混入没有单独剥离。330 个案例对 8 个设置来说每个探针族只有几十条,单项分的置信区间论文没给。人类对齐研究只覆盖九个代表性模型、两个转移设置,观测质量和持续性的对齐数据没报。agent 化评测的算力成本(每个 rollout 要跑多少次 VLM 调用)也全文没提,这直接决定第三方能不能复跑。

术语

原文与代码

社区讨论

相关论文

全部论文解读