UC Berkeley 与 DeepMind 提出 Instruct-to-Act,让世界模型控制器听懂语言指令

berkeley_ai · x · 2026-09-22

Zineng Tang 等人在 COLM 2026 发表论文《Instruct-to-Act: Decoupling Planning and Control for Instructable Actions》,作者来自 UC Berkeley、Vector Institute 与 Google DeepMind。

核心思路:VLM 擅长高层推理但难以产出可靠低延迟动作序列,世界模型控制器擅长快速“观测→动作”却缺乏开放式任务引导。Instruct-to-Act 将两者解耦结合——用 VLM 生成稀疏、高延迟的语言指令,条件化一个可学习世界模型控制器,由其自回归生成高频动作。

要点:

论文与代码均已开源。原文链接:zinengtang.github.io

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →