ModAR 挑战 RGB 表征:3000 万参数从零训练,胜过 60 亿参数视频模型微调
CSProfKGD · x · 2026-09-17
Adamjhung 团队提出 ModAR,质疑机器人 world-action models 用 RGB 像素想象未来的做法:RGB 把容量花在对机器人策略无关的细粒度细节上。
- DINO 特征、point tracks 和深度图能捕捉语义、运动、几何等更有用的信息,但单一模态各有局限。
- ModAR 的做法是逐模态依次预测未来,每次预测为下一次提供信息,并从零开始训练。
- 仅 30.1M 参数的从零训练模型,甚至超过了 6B 视频模型初始化后再微调的版本。
所属事件:ModAR 用 3000 万参数挑战 RGB 表征,省 20 倍算力胜基线(2 条相关)→
「具身」频道最新
- GPT-6 Astra 玩机器人有两条路线:直出动作或当智能体调度 — YuXiang_IRVL · 2026-09-17
- 长文:具身AI未逃引力,十年前协作机器人商业模式已验证会失败 — yongqianme · 2026-09-17
- 深度访谈:Optimus、Figure、1X NEO 人形机器人竞赛真实现状 — MickeySteamboat · 2026-09-17
- Figure 宣布取得 AI 突破,明日将公开演示 — adcock_brett · 2026-09-17
- CoRL 2026 论文 MessyMem:让机器人拥有跨场景持久记忆 — leto__jean · 2026-09-17
- 六年打造 AI 助听器,创业者质问:为何眼镜不用求人戴 — RebeccaBellan · 2026-09-17