不采新机器人演示,因果轨迹把 π0.5 真机成功率抬高 82.2 个百分点

ARC: A Reasoning Recipe for Robot Foundation Models

Gokul Puthumanaillam, Tao Sun, Elie Aljalbout, Moritz Reuss, Zhaoshuo Li, Fabio Ramos, Ankit Goyal, Jenai Xuning Yang

cs.RO, cs.AI

2026-10-09

ARC 把 DROID 里已有的机器人演示自动写成跟动作块对齐的因果说明,用来微调 π0.5 和 Cosmos3。推理向任务最高提升 50 个百分点,真机上 π0.5 成功率从 9.5% 升到 91.7%。

这篇在解决什么

机器人基础模型的主流做法是加演示、加大模型、再跑一轮基础规模训练。π0.5 这类视觉-语言-动作模型看完图像和指令就预测动作,Cosmos3-Nano-Policy 这类世界动作模型还要预测未来画面。通用操作已经做得动,成功率却仍然按数据和训练规模计价。

ARC 走旁路:架构不改,新的机器人轨迹不采,预训练不重做,只给现成模型加推理。计划、物体名单和子任务标签常常能从同一张图、同一句指令里直接猜出来,语言损失过得去,动作头继续看图。图 2 里,动作专家分到自然语言上的相对注意力,子任务监督为 4%,Embodied CoT 为 6%。Embodied CoT 就是把计划、物体和运动方向写成中间文本。能推进控制的轨迹,得写明下一步动作,以及它为什么合适、做完应当发生什么。

方法

配方分三段:轨迹写什么,监督从哪来,控制怎么用上它。

轨迹对齐到一个动作块。七个字段是 State、Cause、Consequence、Effect、Action、Avoid、Completion,依次为当前事实、为何重要、向前推演、打算造成的变化、因此怎么动、要避开什么、完成了没有。模型读到的是收成一段的自然语言,单条大约 700 个字符。

DROID 的 v1.0.1 训练集有 95,658 条,只有观测和动作。Gemini 2.5 Pro 看完整段视频,写叙述并选关键帧,让单帧标注知道进度。GPT-5.5 在低推理档写状态检查,再合成与动作块对齐的轨迹。产出约 74,740 集,占源数据 78.1%,约 120 万帧,每集约 16.1 条,即 ARC-Trace-DROID。状态检查来自模型,不是测量真值。

微调仍用原来的 flow matching:预测速度,把加噪动作移回演示,世界动作模型还移回未来观测。π0.5 的骨干是 PaliGemma,含 SigLIP 与 Gemma 2B,动作专家约 3 亿参数。轨迹经两层编码器接入上下文,视觉编码器、语言骨干和动作专家一起更新。只给真实轨迹时,矛盾说明几乎不改动作,于是约 5% 样本换成反事实轨迹,不计入预测损失,只把一步估计推离演示。Cosmos3 的 8B 推理器本身就会因矛盾文本改变动作,这项惩罚没有增益,训练里去掉,只保留预测损失和轨迹的下一个词损失。窗口是 1 帧观测加 32 帧未来。

执行时权重冻结。外部视觉语言模型按指令和当前相机写轨迹,默认 Qwen3.6-35B-A3B。更新异步进行,坏结果沿用上一条。π0.5 近实时部署多约 10 毫秒,示例为轨迹约 1 Hz、控制 15 Hz。

结果

评测都在 DROID 本体上。微调数据只有 ARC-Trace-DROID,三个模拟基准和真机都没有再训练。

RoboLab-120 把指令分成模糊、默认、具体。两个 ARC 模型在三档都是前两名。

指令模型成功率对照
模糊π0.5+ARC45.1%基座 15.2%,+29.8 个百分点
模糊Cosmos3-Nano+ARC44.9%基座 20.6%,+24.3 个百分点
默认Cosmos3-Nano+ARC48.8%基座 36.8%,+12.0 个百分点
默认π0.5+ARC45.3%基座 28.0%,+17.3 个百分点
具体Cosmos3-Nano+ARC51.2%基座 39.7%,+11.5 个百分点
具体π0.5+ARC45.0%基座 28.1%,+16.9 个百分点

π0.5 基座从具体指令的 28.1% 掉到模糊指令的 15.2%。加上 ARC 之后三档都在 45% 左右,模糊指令下 π0.5+ARC 以 45.1% 排第一。

MolmoSpaces 上 Cosmos3-Nano+ARC 为 57.6%(+18.6 个百分点),π0.5+ARC 为 45.0%(+27.2 个百分点,基座 17.8%)。两个榜都被记成新的最好成绩。

RoboLab-Reasoning-50 由这篇构建,覆盖上下文理解、长程记忆、试探式发现和否定约束。

方法成功率
Cosmos3-Nano+ARC61.0%(基座 11.0%,+50.0 个百分点)
π0.5+ARC57.0%(基座 10.2%,+46.8 个百分点)
π0.5+显式子任务21.0%
Cosmos3-Nano-Policy11.0%
π0.510.2%

显式子任务同样是语言,π0.5 只到 21.0%,因果轨迹到 57.0%。

真机搭了其中 28 项,没有硬件微调。π0.5+ARC 为 91.7%,π0.5 为 9.5%,高 82.2 个百分点;同台 Cosmos3-Nano-Policy 为 11.9%。WAM 的 ARC 版没有真机结果。

默认档上,π0.5+ARC 用 1 步 Euler 得到 27.6%,比 10 步基座的 28.0% 低 0.4 个百分点。Cosmos3-Nano+ARC 用 2 步 UniPC 得到 41.6%,比 4 步基座 36.8% 高 4.8 个百分点,1 步时降到 18.0%。开放训练实现里,ARC 少用约 4.3 倍更新,达到只训指令的基线在 1 万步的水平。

正文里的消融和这些数字对得上。因果字段负责指出哪一种状态变化重要,动作字段把它接到具体的一步;两边缺一边,控制器都补不齐。只训动作头或生成器,不如语言骨干和控制器一起更新。换掉写轨迹的外部模型、冻住同一套 π0.5+ARC,成绩保持接近,没有绑在默认的 Qwen3.6 上。

为什么重要

手里已经有 VLA 或 WAM,不必为推理再采机器人数据,也不必重做基础训练。理由可以从旧演示的视频和动作里补出来。文本走现成的大模型优化,控制回路仍按 15 Hz 跑。

指令可以更粗。下一步要造成的变化由轨迹写明,三档指令的成功率因此贴在一起。记进度、改目标、失败后重试,都是这段文字在执行中刷新。

提升不均匀。具体指令下 Cosmos3 增加 11.5 个百分点,推理套件才到 50。补的是中间表征,控制器没有换代。

局限与存疑

推理留在策略外面。语言骨干会用轨迹,自己写不稳定,所以上线要外挂视觉语言模型。结论点出的后续是自生成轨迹,以及跨本体。目前实验全是 DROID。

最大涨幅出在自建的 Reasoning-50。已有榜上也涨,具体指令下 Cosmos3 只增加 11.5 到 12.0 个百分点。真机 91.7% 对模拟里 π0.5+ARC 的 57.0%,基座两边都近 10%,拉开的是适应后的模型。28 项能否代表整套 Reasoning-50,正文没有说明。

标注约 7.5 万集,用的是 Gemini 2.5 Pro 和 GPT-5.5,状态检查没有独立真值。换标注器对下游的影响,主文没给。代码、权重和数据写明审稿后公开。1 Hz 的轨迹配 15 Hz 的控制,动作块吃的是稍早的判断。注意力从 6% 升到 41% 只是诊断:动作专家读了这些词,还不等于行为一定受它驱动。

术语

原文与代码

社区讨论

相关论文

全部论文解读