将机制可解释性引入视频模型:探秘潜在空间物理模拟器

mathemagic1an · x · 2026-08-03

研究者将 Anthropic 的 Dictionary Lens(J-lens)应用于视频生成模型,探讨 Transformer 是否真正学习了物理规律,还是仅仅在做随机的像素拼接。

研究发现,模型在训练过程中自发形成了因果世界模型,其潜在空间表现如同一个无监督的模拟器,甚至可以像电子游戏一样进行交互操作。这表明视频模型内部可能已经涌现出对物理法则的隐式理解。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →