世界模型新基准 PlayWorld:像玩游戏一样评测长程目标
机器之心 · wechat · 2026-08-23
香港大学、快手等团队提出 PlayWorld,一种像用户“玩游戏”一样评测世界模型的新基准。
核心痛点
- 传统固定轨迹评测无法保证不同模型到达相同视角,且忽略了长程目标的完成度。
创新机制:AgentPlayer
- 不再固定按键序列,而是给定“场景”和“长程目标”。
- AgentPlayer 实时观察生成视频,做出 5 种决策:Keep, Stop, Extend, Correct, End,以适应不同模型的控制粒度。
四大评测维度
- 几何一致性:绕行/重访后,物体身份、位置、纹理是否保持。
- 交互保真度:动作是否符合物理规律(如入水是否有涟漪)。
- 视野外演化:目标离开画面后,世界是否继续因果演化。
- 视野内演化:长时观察中,过程是否真正向前发展。
实验发现
- 瓶颈:几乎所有模型在持续状态演化(视野内/外)得分极低,难以维护跨时空语义状态。
- 空间一致性:长时重访暴露全局空间不一致(如 360° 旋转后地标变样)。
- 到达 ≠ 理解:高轨迹通过率不代表高世界理解力(如 SANA-WM 到达率高但综合得分低)。
「研究」频道最新
- 神经科学家:纯文本训练只用了视觉能力的一半 — 3scorciav · 2026-08-23
- JFPuget 团队宣称 100% 攻克公开版 ARC-AGI 基准 — JFPuget · 2026-08-23
- 美国国家实验室曾研发蒙特卡洛与 Numpy 基石算法 — MikePFrank · 2026-08-23
- 论文提出分类分布集合 JSD 质心的计算方法 — FrnkNlsn · 2026-08-23
- 实战构建 Claude 文本水印移除器,重写法最有效 — Imaginary_Dinner2710 · 2026-08-23
- 2026 年 RSI 成核心战略,AIBuildAI 取代规模扩展 — 机器之心 · 2026-08-23