ModAR 首个多模态自回归世界-动作模型:省 20 倍算力胜过基线
Adam Hung · hf · 2026-09-16
ModAR 是首个在预测动作前自回归去噪多种未来模态的世界-动作模型(WAM),让每次预测都能以前面已生成的模态为条件。
- 关键结论:预测点轨迹、DINO 特征和深度图对 WAM 有益,而额外预测未来 RGB 反而无稳定收益。
- 效果:ModAR 的顺序生成优于现有 WAM 形式,在所有数据规模下平均成功率最高。
- 效率:在视频模型初始化的 Flex-π 上,ModAR 成功率略高(75% vs 72%),训练 FLOPs 少约 20 倍且无需预训练。
- 真实机器人:在三个真实双手操作任务上超过基线,并能从人类视频中获益。
「具身」频道最新
- Apple 推出 Reference Image:传感器端哈希原始底片实现可验证摄影 — nptacek · 2026-09-16
- 可穿戴会议冠军竟是家丝袜公司:传感器可预测生理期 — Scobleizer · 2026-09-16
- 两门高质量机器人课程推荐:斯坦福 Majumdar 与 oier_mees 开放资源 — micoolcho · 2026-09-16
- 自动驾驶卡车驶上俄亥俄州道路,L4 级首次无人试运营 — bennash · 2026-09-16
- 半人形机器人 OpenShell 亮相展台,Chris Paxton 惊叹「树懒机器人」 — chris_j_paxton · 2026-09-16
- Flow Chaser 登陆 Vision Pro:端侧 AI 把任意歌曲自动变成音游关卡 — Scobleizer · 2026-09-16