仅400万参数视频模型涌现物理规律,可被提取为可控世界模型
作者@mathemagic1an通过实验探讨了视频模型是否真正理解物理规律。他搭建了一个包含碰撞和墙壁反弹的简单物理环境,训练了一个约400万参数的像素Transformer来预测下一帧,成本仅约10美元。研究表明,该模型并非单纯进行像素插值或死记硬背训练集,而是在内部形成了物理规律的表征,并可通过特定方法转化为可交互控制的世界模型。
已确认
- 模型在中间层存在一个明显的“物理涌现区”,物理信息在此处变得可读。
- 将第5层激活按运动方向求平均并进行PCA后,会出现明显的圆环结构,且物理世界相邻的方向在模型内部表示中也保持邻近。
- 模型的激活可以通过线性映射直接读出X/Y坐标,并在更深层提前数步预测碰撞。
- 将特定碰撞场景留作未见样本,模型依然能较正确地模拟结果,这削弱了“只是背诵训练集”的解释。
- 借助Anthropic的Jacobian lens,成功从一个只看像素、没有动作标签的模型中提取出可写入的运动方向,并将其制作成可通过键盘控制的交互小游戏。
为什么重要
- 揭示黑盒机制:现代视频模型在处理对象恒存和遮挡时表现出强大的连续追踪能力。弄清楚这些物理信息如何在模型内部表征,有助于更好地理解和控制大型视频生成模型。
- 因果世界模型的潜力:实验表明,仅用原始像素训练Transformer,就有可能得到一个具备因果逻辑、甚至能像游戏一样被“玩起来”的世界模型,这为视频模型的实际应用与可控生成提供了新思路。
2026-07-29 ~ 2026-07-29 · 10 条相关
一手来源
- 400 万参数像素 Transformer 花 10 美元学会小型物理游戏 — mathemagic1an ·
- Anthropic Jacobian lens 从像素模型里挖出可写入运动方向 — mathemagic1an ·
- 视频模型出现“物理涌现区”,运动方向在中层才变得可读 — mathemagic1an ·
- 用雅可比透镜解剖视频模型:4M参数涌现物理世界模型 — mathemagic1an · 2026-07-29
- Anthropic J-lens 把像素视频模型变成可玩的世界模型 — mathemagic1an · 2026-07-29
- 现代视频模型对对象恒存和遮挡的理解很强 — mathemagic1an · 2026-07-29
- 【源头】400 万参数像素 Transformer 花 10 美元学会小型物理游戏 — mathemagic1an · 2026-07-29
- 视频模型究竟在记忆,还是在学物理规律 — mathemagic1an · 2026-07-29
- 视频模型在未见碰撞场景里依然能泛化 — mathemagic1an · 2026-07-29
- 视频模型激活可线性读出坐标,还能提前预测碰撞 — mathemagic1an · 2026-07-29
- 【源头】Anthropic Jacobian lens 从像素模型里挖出可写入运动方向 — mathemagic1an · 2026-07-29
- 视频模型的运动方向在激活空间中形成环形结构 — mathemagic1an · 2026-07-29
- 【源头】视频模型出现“物理涌现区”,运动方向在中层才变得可读 — mathemagic1an · 2026-07-29