AI玩家替人测评,九个世界模型没一个能扛住长程交互

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

cs.CV

2026-08-14

PlayWorld让agent像人类玩家一样操作世界模型完成长程目标,171个场景测九个模型,普遍在空间一致性和持续状态演化上翻车。

这篇在解决什么

视频世界模型(比如Genie 3、HappyOyster这类能根据用户操作实时生成交互式视频的系统)评测一直有个难题:人评价一个世界模型好不好,通常是带着一个高层目标去互动,比如原地转一圈看看环境是否还认得出来,或者走进水里看看有没有真实的水花。但不同模型对同一套操作指令的响应幅度天差地别,同样是按三次右转,有的模型转了360度回到原位,有的只转了一部分。用固定的动作序列去驱动不同模型,结果没法直接比较,而Genie 3、HappyOyster这类闭源模型还只能通过网页交互访问,人工测试成本极高。

方法

PlayWorld引入Agent Player,一个多模态agent(用Claude或Gemini这类模型),负责模拟人类玩家的操作。每个测试案例给一个人工标注的基础动作序列作为共享的初始参考(避免agent每一步都要从零规划,拖慢速度、也让跨模型比较失去统一意图),agent在每一步观察世界模型生成的画面、已执行的动作和目标,决定保持、提前停止、延长、纠正下一步、结束五种操作之一,动态调整实际执行的动作数量和时长,直到判定目标达成才结束。

评测覆盖四个维度:几何一致性(转一圈、离开又回来,场景结构还在不在)、交互真实性(撞墙会不会穿模、踩水会不会有水花)、离视野外演化(转头看别处再转回来,离开视野的东西有没有继续合理变化)、洞察力演化(固定镜头观察60秒,场景是否持续自然演化)。每个案例配一套针对性设计的VQA是非题,由Gemini 3.1 Pro打分并加权聚合成1-5分。171个人工标注案例覆盖50种动作模式,九个代表性世界模型总共跑出1400多段交互视频、820多道问题。

结果

九个模型里,闭源的Genie 3综合得分最高(2.12/5),开源里表现最好的是LingBot-World2(1.82)。四个维度的具体分数:

模型几何一致性交互真实性离视野演化洞察力演化
Genie 32.742.401.811.51
HappyOyster2.542.151.541.47
Matrix-Game-3.0(最低)1.301.251.001.00

洞察力演化维度上,九个模型没有一个平均分超过2分,最好的LingBot-World2也只有1.95分,说明固定镜头下让场景自然持续演化这件事,对当前所有测试模型都很难。轨迹有效性(是否真的按目标路径完成动作)上,Genie 3达到87.1%,而HY-WorldPlay只有41.6%,反映出不少模型在长程动作执行上根本没走到该到的地方。600次人类两两对比打分和VQA自动打分的Spearman相关系数全部为正,说明这套自动化评测和人类主观感受基本吻合。

为什么重要

对做交互式世界模型的团队,这篇给出了一套可复用的评测范式:与其死磕模型能不能精确执行固定的动作序列,不如像PlayWorld这样评给定同一个高层目标模型能不能达成,这样才能把不同动作粒度的模型放到同一把尺子上比较。171个场景、四维度评分体系目前公开可用,可以直接拿来对比自己的世界模型和这九个基线。更实际的信号是:即便是目前最强的Genie 3和HappyOyster,在离视野演化和洞察力演化这两个持续状态维度上得分也就1.5分左右(满分5分),说明让世界在你看不见的地方继续合理运转这件事,距离能用还有很大差距,这对想拿世界模型做长时间沉浸式应用(游戏、具身智能训练环境)的团队是个明确的预警。

局限与存疑

Agent Player本身用的是Claude或Gemini这类现成的多模态模型做决策,论文没有测试换一个更弱或更强的agent模型会不会显著改变最终打分结果的相对排名,也就是说Agent Player自身的能力边界有没有影响到评测的公平性,这一点没有消融实验支撑。VQA打分同样用的是Gemini 3.1 Pro,评分模型和部分被测世界模型(如果未来出现Gemini自家的世界模型)之间的潜在偏袒风险论文没有讨论。案例规模是171个,对九个模型、四个维度、多种场景类型做拆分后,单个子类别的样本量其实不大,分数的统计稳定性没有给出置信区间。

术语

原文与代码

社区讨论

相关论文

全部论文解读