视频模型激活可线性读出坐标,还能提前预测碰撞
mathemagic1an · x · 2026-07-29
这条回复继续展开同一研究思路:视频模型内部对物理世界的表征,可能比外表看起来更“显式”。
- 激活里可以用线性映射直接读出 X/Y 坐标。
- 更深层还能提前 عدة 步预测碰撞。
- 这说明模型未必只是“像素插值”,而是在形成对象与关系的高层表示。
- 作者据此引出后面的 Jacobian lens 实验:把内部方向变成可控的运动信号。
所属事件:研究称400万参数视频模型涌现物理世界表征(4 条相关)→
「多模态」频道最新
- AI 短视频把“绑架”拍成了分身梗 — umesh_ai · 2026-07-29
- Claude游戏艺术能力飞跃:一年前后对比令人惊叹 — iamfakhrealam · 2026-07-29
- SDXL图像生成:如何构建复杂的多角色互动视角 — ZeHirMan · 2026-07-29
- Hailuo AI 新视频模型据称可接收 12 组图文音频参考 — aziz4ai · 2026-07-29
- PDD 通过一次预测多步去噪加速图像和视频生成 — ArashVahdat · 2026-07-29
- 一条 AI 周报塞进机器人 MMA、FLUX 3 和艺术之争 — PurzBeats · 2026-07-29