ModAR 用 3000 万参数挑战 RGB 表征,省 20 倍算力胜基线

Adamjhung 团队提出 ModAR,首个在预测动作前自回归去噪多种未来模态的世界-动作模型(WAM),可预测点轨迹、DINO 特征和深度图等模态,且每次预测能以已生成模态为条件。该研究质疑机器人 world-action models 用 RGB 像素想象未来的做法,认为 RGB 把容量浪费在与机器人策略无关的细粒度细节上。ModAR 仅用 3000 万参数从零训练便胜过 60 亿参数视频模型微调,并节省约 20 倍算力。

2026-09-16 ~ 2026-09-17 · 2 条相关