将机制可解释性引入视频模型:探秘潜在空间物理模拟器
mathemagic1an · x · 2026-08-03
研究者将 Anthropic 的 Dictionary Lens(J-lens)应用于视频生成模型,探讨 Transformer 是否真正学习了物理规律,还是仅仅在做随机的像素拼接。
研究发现,模型在训练过程中自发形成了因果世界模型,其潜在空间表现如同一个无监督的模拟器,甚至可以像电子游戏一样进行交互操作。这表明视频模型内部可能已经涌现出对物理法则的隐式理解。
「研究」频道最新
- NeurIPS 审稿像买彩票?学者吐槽遭遇敌意评审与不作为 AC — WhiteBear2018 · 2026-08-03
- NeurIPS 2026将举办LLM可解释性科学基础研讨会 — hugo_larochelle · 2026-08-03
- NeurIPS 2026 研讨会征稿:聚焦人机耦合系统的动态对齐 — huashen218 · 2026-08-03
- AI 学术界面临双盲评审危机:arXiv 预印本破坏匿名性 — deliprao · 2026-08-03
- 实证研究:AlphaFold究竟如何重塑科学发现? — soumitrashukla9 · 2026-08-03
- AI Agent正在摧毁学术会议的双盲评审机制 — deliprao · 2026-08-03