ModAR:世界动作模型逐模态预测未来,30M参数胜过6B视频模型微调
k7agar · x · 2026-09-17
针对世界动作模型(world-action models)通常用 RGB 像素想象未来、而像素会把容量浪费在对机器人策略无关的细节上的问题,研究者提出 ModAR:改用 DINO 特征、点轨迹和深度等捕捉语义、运动与几何的模态,逐次预测一种模态并由前一预测指导下一次。模型从零训练,30.1M 参数的版本甚至优于基于 6B 视频模型初始化再微调的模型。转发者认为可自选预测与使用模态的思路很酷,值得看规模化表现。
所属事件:ModAR 挑战 RGB 表征:3000 万参数胜 60 亿视频模型(3 条相关)→
「具身」频道最新
- ActionPiece 重构 VLA 动作分词,LIBERO 达 94.8% — DeepCybo · 2026-09-17
- 特斯拉 Optimus 通过「证明你是人类」CAPTCHA 测试 — TansuYegen · 2026-09-17
- 仿生机器鱼亮相服贸会,摆尾推进不用螺旋桨 — rohanpaul_ai · 2026-09-17
- 曝 OpenAI GPT-6 Astra 基于 Stargate 超10万 GPU 预训练 — erwincoumans · 2026-09-17
- 优必选发布 U1 系列超逼真陪护人形机器人,隐私存疑 — TansuYegen · 2026-09-17
- Ulysses 联创谈水下机器人 Mako:海底测绘与海草修复 — Scobleizer · 2026-09-17