ModAR:世界动作模型逐模态预测未来,30M参数胜过6B视频模型微调

k7agar · x · 2026-09-17

针对世界动作模型(world-action models)通常用 RGB 像素想象未来、而像素会把容量浪费在对机器人策略无关的细节上的问题,研究者提出 ModAR:改用 DINO 特征、点轨迹和深度等捕捉语义、运动与几何的模态,逐次预测一种模态并由前一预测指导下一次。模型从零训练,30.1M 参数的版本甚至优于基于 6B 视频模型初始化再微调的模型。转发者认为可自选预测与使用模态的思路很酷,值得看规模化表现。

所属事件:ModAR 挑战 RGB 表征:3000 万参数胜 60 亿视频模型(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →