τ0-VLA给子任务加世界模型搜索,长程家务平均成功率从27.5%升到45%

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

cs.RO

2026-08-18

τ0-VLA用世界模型搜索下一步子任务,底层是4万小时跨本体VLA。四项长程任务分层成功率45%对直接执行27.5%,测试时计算把整理书架从6/10做到9/10。

这篇在解决什么

长程操作不是一串更密的电机指令。扫地、炒菜、做奶茶,真正致命的是子任务选错:盐已经加过但看不出来,下一步还去加;包已经挂上却去挂第二次。低层控得再稳,也救不回来。

现在的分层 VLA 多半一次前向就吐下一个子任务。模型既不比较候选,也不先想象执行完世界会长什么样。错了要等环境被改掉才知道,再规划也付过代价了。τ0-VLA 把「下一步干什么」做成可随难度加计算的推理问题。子任务正好夹在动作搜索和纯语言规划中间:稀疏到值得算,又长到能在画面里看出差别。

方法

系统两层。高层维护一段可纠错的执行记忆,需要时才启动测试时计算;底层拿选定的子任务去出动作。

高层四个模块。proposal、value、reflective 都从同一份机器人预训练的 Qwen3.5-9B 微调,世界模型从 Step1X-Edit 初始化。每一步 proposal 先根据当前多视角观察、任务指令、记忆和上一个子任务,更新记忆并给出直接提案。同一趟前向的 token 置信度做路由:全体生成 token 的平均概率,加上 memory 字段里的平均 logit 间隔,任一低于任务阈值就走搜索。阈值按任务在验证集上标定,路由本身不再调一次模型。

搜索是 propose–predict–evaluate 的波束搜索。对每条保留分支采样 N 个候选子任务,世界模型只看头部相机图,预测该子任务做完后的终态图像,value 模型按任务指令、候选和预测图打五档分,映射到 0.05–0.95。按累计分留 B 条,展开到深度 D。搜索内部的记忆只在分支里,不覆盖真实记忆。最后 reflective 模型看着真实观察对齐的上下文和保留分支摘要,生成最终子任务,可以跟某个候选一样,也可以另写一条。

记忆会自己修。演示里的记忆被故意弄滞后、超前或跟视觉冲突,高层要先把记录改对再出子任务,不需要额外人工标注。value 和 reflective 的训练数据来自 proposal 与世界模型离线滚出来的想象轨迹,候选对照真实下一步打标。

底层是 Qwen3.5-2B 视觉语言骨干加 Mixture-of-Transformers 动作专家,条件流匹配出动作块。状态和动作统一成 40 维,覆盖末端、关节、夹爪、腰和移动底盘,无效通道用 mask。同一套接口覆盖固定底座、双臂和全身移动。训练数据 40115 小时异构真机,外加多模态共训。三阶段:先知识隔离共训,再端到端,最后对部署任务做少量微调。动作块长度 H=30,推理用 10 步 Euler。

结果

四项长程任务各 10 次真机试验,对照都是直接把整句任务指令喂给底层。平台是 AGIBOT G1,单次成功 rollout 大约 3 到 10 分钟,打扫房间最长约 8 分钟、25 步。

方法平均成功率平均进度
GR00T N1.72.5%45.29%
LingBot-VLA0%44.43%
π0.522.5%73.05%
τ0-VLA 直接执行27.5%80.10%
分层 Plan Once45.0%87.85%

分层不加搜索,就把西红柿炒蛋从 0/10 拉到 4/10。论文点明瓶颈是放盐:画面几乎不变,没有记忆的策略会反复加或干脆跳过。打扫房间从 4/10 到 5/10,进度 92.80% 到 94.80%,失败从挂包和跨房间收尾集中暴露。做奶茶两项都是 5/10,分层进度 91.92%,略低于直接执行的 96.15%,短板在盖盖和插吸管这种接触密集步骤。

测试时计算再加一档。开放环下,整理书架 OOD 初始摆放的下一步预测:Plan Once 50.0%,Best-of-N 57.5%,TTC 74.0%。闭环真机:

任务Plan OnceTTC
做奶茶5/10, 91.92%7/10, 95.38%
整理书架6/10, 66.67%9/10, 93.33%
打扫房间5/10, 94.80%7/10, 97.60%

书架没有固定脚本,TTC 的增益最大。算力–精度曲线在低预算上升得快,随后饱和。

跨本体短任务关掉高层,只测底层。ARX AC One 上收衣服 10/10、进度 97%,π0.5 是 9/10 / 88%。双臂 Franka 梳妆台三组指令跟随里,化妆粉扑 10/10 / 95%,对照最高是 π0.5 的 7/10 / 73.75%。

为什么重要

给分层 VLA 补了一块 LLM 圈已经用熟的东西:难决策多花计算,容易的一步过。世界模型用在「选哪个子任务」之前,不是用来给已经选定的子任务画一张目标图。跟 π0.5 比,同样底层接口下,记忆加分层就把长程平均成功率从 22.5% 抬到 45%;再开 TTC,没有固定顺序的任务还能再涨。

能用的人是已经有子任务标注、能跑图像编辑式世界模型、也接受按任务微调底层的团队。40115 小时和 Qwen3.5-9B 级别的高层,不是一张消费卡能复现的。

局限与存疑

没有独立的 Limitations 节。每格只有 10 次试验,成功率差 2/10 时统计很吵。底层第三阶段按任务微调,路由阈值也按任务标定,跨任务零样本这件事论文没测。

世界模型只预测头部相机一张图,多视角和本体状态不在想象里。做奶茶上分层 Plan Once 的进度还低于直接执行,说明分解不是免费的。盖盖、插吸管、打蛋这些接触步骤,算力加在高层也救不了。Best-of-N 已经共用世界模型和 value,TTC 多出来的主要是多步展开和 reflective,论文没把这两项再拆开。

术语

原文与代码

相关论文

全部论文解读