PAWBench 揭示视频生成模型缺乏概率对齐能力
Hugging Face 等机构的研究者发布 PAWBench 与 PAWEval,首次系统评估视频生成模型作为随机采样器时能否匹配参考行为分布,即所谓「概率对齐」。结果显示,11 个受测视频生成器虽然能生成逼真画面,但没有一个能同时准确刻画「可能发生什么」和「发生的概率」。
已确认
- 研究提出了 PAWBench 和 PAWEval,将世界模型的概率对齐要求形式化,并评估 11 个视频生成器的物理世界建模能力。
- 实验发现模型无法匹配参考行为分布:即使明确告知期望结果,模型也仅在 38–58% 的情况下生成该结果。
- 模型行为存在系统性偏差:对无关线索反应过度,而对真实物理变化反应不足。
- 作者尝试了三种修复方案——更清晰的结果指令、更多样的采样、额外训练——每种各解决一部分问题,但没有一种能端到端修复。
- 作者以掷骰子为例说明问题:模型可能生成看似逼真的画面,却重复出现少数几种结果,无法覆盖真实结果分布。
为什么重要
- 作者 @RisingSayak 指出,对创意工具而言生成一个好视频或许足够,但对用于规划的世界模型远远不够——它必须同时刻画「哪些结果可能发生」以及「每种结果发生的可能性有多大」。当前模型在这方面的缺陷意味着它们距离可用的世界模型仍有本质差距。
2026-08-28 ~ 2026-08-28 · 5 条相关
一手来源
- PAWBench 揭示:当前世界模型难以匹配参考行为分布 — Yuandong Pu ·
- PAWBench实测:给定目标结果,视频模型仅38–58%概率生成 — RisingSayak ·
- 新研究:视频生成器未能通过世界模型概率对齐测试 — RisingSayak ·
- 【源头】PAWBench 揭示:当前世界模型难以匹配参考行为分布 — Yuandong Pu · 2026-08-28
- 新论文 PAWBench:评估视频模型是否捕获概率分布 — RisingSayak · 2026-08-28
- 为什么世界模型需要「概率对齐」:一个好看的视频远远不够 — RisingSayak · 2026-08-28
- 【源头】PAWBench实测:给定目标结果,视频模型仅38–58%概率生成 — RisingSayak · 2026-08-28
- 【源头】新研究:视频生成器未能通过世界模型概率对齐测试 — RisingSayak · 2026-08-28