Flex-π:6B 参数世界动作模型靠预测 3D 几何大幅省数据
chris_j_paxton · x · 2026-09-23
Chris Paxton 在 RoboPapers 第 106 期解读 Flex-π,并补充了自动生成、经 ChatGPT 校对的可搜索文字稿。
核心内容:
- 现有世界动作模型(WAM)几乎都只预测 RGB 像素,但颜色对机器人并不重要,关键是 3D 几何和物体语义。
- Flex-π(6B 参数)发现一个「免费午餐」:同一个冻结的视频生成 VAE 在编码 RGB 的同时,几乎无损地编码了 3D pointmap,无需任何 pointmap 专项训练。
- 因此可以在 RGB 之外同时监督 3D pointmap 和 DINO 物体语义特征,不增加传感器、预训练或推理延迟。
- 所有视觉信号投影到共享潜空间,在 Mixture-of-Transformers 骨干中与动作联合去噪,配合 per-stream dropout 与跨模态 forcing。
- 结果:样本效率显著提升,能泛化到复杂、精确的长时程任务。
所属事件:Flex-π 机器人世界动作模型发布 预测3D几何大幅省数据(3 条相关)→
「具身」频道最新
- TUM 团队发布物理先验机器人学习综述,提出统一分类法 — TUM-AVS · 2026-09-23
- ROSCon 现场:RealSense 与 NVIDIA 机器人 AI 演示引人注目 — chrismatthieu · 2026-09-23
- Joga 人形机器人足球系统:主动视觉带球射门,sim2real 缺口收窄 — ericjang11 · 2026-09-23
- 人类根本遥操作不了的任务,GLIDE 用 LLM 写过滤器把成功率从 0 拉到 70% — stepjamUK · 2026-09-23
- Ondas 并购补齐感知、抗断连与拒止环境导航,推进自主系统组合 — CeoOndas · 2026-09-23
- 机器人末端执行器专家 Max Titov 离开 1X 自立门户 — chris_j_paxton · 2026-09-23