UC Berkeley 与 DeepMind 提出 Instruct-to-Act,让世界模型控制器听懂语言指令
berkeley_ai · x · 2026-09-22
Zineng Tang 等人在 COLM 2026 发表论文《Instruct-to-Act: Decoupling Planning and Control for Instructable Actions》,作者来自 UC Berkeley、Vector Institute 与 Google DeepMind。
核心思路:VLM 擅长高层推理但难以产出可靠低延迟动作序列,世界模型控制器擅长快速“观测→动作”却缺乏开放式任务引导。Instruct-to-Act 将两者解耦结合——用 VLM 生成稀疏、高延迟的语言指令,条件化一个可学习世界模型控制器,由其自回归生成高频动作。
要点:
- 训练无需人工标注:对控制器策略 rollout 的片段做事后标注(post-hoc annotation)指令,再用行为克隆优化,使控制器变得“可语言指令化”。
- 接口灵活:任何 VLM 或人类都可接入该控制器接口,且可方便切换不同 VLM。
- 自然支持多智能体扩展:VLM 之间通过训练好的控制器作为执行器进行通信,无需多智能体强化学习算法。
- 报告了多种具身环境与任务上的结果,含控制器与 VLM 规模化趋势,以及指令频率、规划频率、在线/离线规划延迟的消融实验。
论文与代码均已开源。原文链接:zinengtang.github.io
「具身」频道最新
- Cybercab 第 67 辆加入特斯拉奥斯汀 robotaxi 车队 — EricETesla · 2026-09-22
- 旧金山笼斗现场:机器人当众把人打趴 — Charuru · 2026-09-22
- 斯坦福三层架构让 GPT-6 Astra 攻克 RoboMME,成功率 79.13% — DJiafei · 2026-09-22
- 俄勒冈州立团队让多台人形机器人协作夹取搬运,无通信单策略 — tweetsatpreet · 2026-09-22
- 沙特 Ceer 发布 AI 设计概念机器人 Exobot — aziz4ai · 2026-09-22
- 一周 AI 盘点:世界模型加速落地,Helix 2.5 家务成功率升至 56% — TheTuringPost · 2026-09-22