WLA-0让机器人先想再动
Gradio · x · 2026-07-12
研究者提出了 WLA-0,一个统一的世界-语言-行动模型,输入文本、图像和机器人状态,先预测子任务、再生成动作,用来把世界建模与语言推理结合起来。
主要结果
- 在长程任务上取得了较强表现:RoboTwin2.0 92.9%、RMBench 56.5%。
- 论文还展示了一个关键消融:如果去掉“先用文字规划再行动”的步骤,成功率会从 56% 降到 17%,说明这一步非常重要。
- 模型可以直接从机器人视频学习,不需要动作标注。
- 推理速度约 40ms/次,在 RTX 5090 上运行。
论文要点
- 目标是把世界建模、语言推理、动作合成统一到同一框架中。
- 通过逐步预测的方式,让模型既能理解环境,也能生成可执行动作。
- 适用于长时序、需要规划的机器人任务。
「具身」频道最新
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11