PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
cs.CV, cs.AI
2026-08-28
PAWBench用50个场景、每场景50次重复生成检验视频模型是否对齐随机物理结局:11个系统没有一个同时校准概率并覆盖全部合法结果。
视频生成模型越来越被当成世界模型来卖:给一张初始图和一个动作提示,生成接下来会发生的画面。单条视频看起来合理,并不等于模型懂随机过程。抛硬币、转轮盘、保龄球击瓶,同一初始状态可以走出多种合法结局。现有评测多半打单条视频的画质、时间连贯和物理看上去像不像,重复采样会不会塌缩到某一种结局、概率对不对,几乎没人测。
这篇把这个缺口叫 probabilistic alignment:在固定观察和动作下,模型诱导的结局分布既要覆盖合法支撑集,也要把质量分对。
PAWBench 做了 50 个场景,分八类机制。PAW-Calibration 25 个场景有解析或对称性给出的参考分布,比如抛硬币、转轮。PAW-Coverage 25 个场景能枚举合法结局但给不出可靠概率,比如保龄球、瓶翻。每个场景固定源图像和动作提示,每个模型滚 K=50 次。
PAWEval 用带 rubric 的 Gemini 3.5 Flash 把可读且在 schema 内的视频映射到终局标签,读不出来的单独记为 readout failure。Calibration 用条件总变差距离(TVD),Coverage 用合法结局覆盖率。场景要通过 readout 门:50 次里至少 20 次能读出结局。源图像是生成的,场景由人工按「随机性来自可见物理机制、动作原子、结局可区分」三条审过。
评完基线后,再从三处动手:语言提示(VLM 采样未来、GPT-5.5 写提示、Oracle 指定目标结局)、耦合初始噪声 C2C、以及用不同左右倾倒比例的铅笔画做 LoRA 微调。
11 个系统里,没有一个同时把概率校准好、把合法结局覆盖全、还在多数场景过 readout 门。
| 模型 | Calibration TVD↓ | Cal. SPR | Coverage↑ | Cov. SPR |
| Cosmos 3 Super I2V | 20.5 | 80% | 55.2% | 92% |
| MiniMax H3 | 24.2 | 68% | 48.7% | 92% |
| Seedance 2 | 30.5 | 100% | 50.9% | 84% |
| LTX-2.3 | 30.1 | 24% | 71.7% | 72% |
| HappyHorse | 43.1 | 92% | 47.1% | 100% |
覆盖最广的模型不是校准最好的。观测到的平均 TVD 是 31.2;从参考分布做匹配抽样,99% 的模拟平均 TVD 低于 9.22,有限采样解释不了这个缺口。888 条有明确终局的视频上,PAWEval 和人类多数票一致 722 条(81.3%)。
因果干预测下来,模型对真正改物理转移的扰动反应不足或方向错,对无关文字却会挪概率质量。语言侧更糟:五个 VLM 直接采样未来,Calibration TVD 最好也有 34.8(GLM-5V Turbo)。把 GPT-5.5 选出的结局交给生成器,四个模型的 Calibration TVD 全部变差。Oracle 指定目标后 TVD 下降、覆盖上升,生成器命中指定结局也只有 37.6%–58.1%。C2C 耦合噪声能在固定预算里探得更开,改的是有限画廊的探索,不是学到的分布。LoRA 把左倾训练比例从 0% 拉到 100%,两个场景的左倾频率一起走,没有一个检查点能同时满足直立笔 50/50 和左倾笔 100/0。
「看起来像世界模型」和「按对的概率采样未来」是两件事。规划、风控、交互都依赖后者。PAWBench 把这件事做成可打分的诊断,并说明提示词、噪声和粗粒度微调都治不好「分布该随物理状态变」这件事。做视频世界模型的人,至少该把重复采样的结局直方图当成一等公民指标。
作者自己写了三条。评的是终局标签,不是轨迹级动力学。估计来自有限次 rollout,加大 K 能多看见结局,校正不了偏置的质量分配。场景是可控、视觉可解析的玩具物理,没有长程交互和具身环境。另外,源图像本身是生成的,参考分布靠对称性推导,真实世界的硬币未必 50/50。PAWEval 仍有约 19% 与人类不一致,失败样本被排除在条件指标之外,SPR 低的模型(LTX-2.3 Calibration 只过 24%)其 TVD 均值要谨慎读。