World Action Agent:VLM 驱动机器人操作,LIBERO-Pro 成功率 75.6%
Yehang Zhang · hf · 2026-09-25
World Action Agent (WAA) 提出让 VLM 通过多智能体框架直接驱动机器人操作的新方案。
- 核心设计:视觉动作工作区具备三个特性——自动从场景几何选取的接触视角;把每个动作变成可编辑提案的「动作预演」,由智能体或 Imagination Agent 预览修订后再执行;在观察视角内闭环修正残余偏移
- 技能获取:从专家视频与人类示教中在证据审查下演化多模态技能,经 Skill Agent 调用;交互轨迹可微调更小的 VLM 驱动同一框架
- 结果:仅用 LIBERO-90 演化的技能,在 LIBERO-Pro 上达到 75.6% 平均成功率,超过端到端 VLA、code-as-policy 与同骨干视觉框架基线,技能迁移到 robosuite 仍有效;用轨迹微调 Qwen3.5-9B,域外成功率从 1.7% 提升到 43.3%
「具身」频道最新
- HRI 2027 新设存档级工业白论文赛道,征集机器人落地实践 — petitegeek · 2026-09-25
- Google 员工设想:用智能眼镜实时看见并「拍肩指挥」AI Agent — jason_mayes · 2026-09-25
- 用 iPhone LiDAR 做攀岩 3D 分析:开源视觉工具链解读 — dosco · 2026-09-25
- Menlo 开源人形机器人 Asimov 1 运动控制策略与训练代码 — freelerobot · 2026-09-25
- IROS 2026 人机对话研讨会下周举行,MIT 与 NVIDIA 讲者云集 — dhadfieldmenell · 2026-09-25
- AI 眼镜上半年出货量暴涨 263%,智元第 2 万台机器人交付 — 创业邦 · 2026-09-25