Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
Sangoh Lee, Sangwoo Mo, Wook-Shin Han
cs.RO, cs.AI, cs.CV
2026-08-25
用冻结的教师VLM把示范片段的行为目标蒸进动作解码器。GR00T-N1.7在SimplerEnv-Bridge从64.3%升到84.7%,真机三条件平均成功率从62.0%提到68.7%。
VLA 把图像和指令映射成连续动作,动作解码器仍主要靠行为克隆:示范里这一帧该输出哪个电机指令。它不管这段动作在当前指令下要达成什么局部目标。同一套接近、抓住、放下,在「叠方块」和「放进篮子」里目标不同;同一个目标也可以走出很不一样的轨迹。
补未来帧、子目标图、轨迹、光流,能告诉解码器接下来长什么样。监督的是某一次实现,不是这些实现对齐的语义目标。INDI 的主张很窄:解码器应该显式恢复这段行为要完成什么。
训练时,冻结的教师 VLM(默认 Cosmos-Reason2-8B)看当前观测、指令、动作的粗摘要,以及这段示范视频,生成功能目的陈述。意图目标取教师中间层的多模态隐状态;文本目的取生成句的末层表示;视觉结果取终点帧的冻结视觉特征。
部署端的 VLA 仍然只吃标准输入:图像、指令、本体感觉。解码器加一组可学习的 intent query,在大约一半深度处对齐教师意图。后面的层同时预测动作(原来的 flow matching)、视觉结果和文本目的。注意力不对称:intent query 不看被加噪的动作行,动作行可以看意图和 grounding。训练中 50% 的步把非意图行对 VLM 上下文的直连关掉,信息必须穿过意图。再加一条 mismatch 损失:把意图换成 batch 里另一条,下游损失必须比匹配时更高。
部署时教师、缓存目标和对齐头全部拿掉。GR00T-N1.7 参数从 3.46B 到 3.50B,单次推理 56.1 ms 到 61.5 ms。
SimplerEnv-Bridge 四个桌面任务上,GR00T-N1.7 从 64.3% 到 84.7%(+20.4)。EP-Basket 从 36.0% 拉到 96.0%,其余三个任务平均 +7.1。未来监督变体只到 68.0%。π0.5 从 52.3% 到 58.8%。
RoboCasa Kitchen 24 项、每任务 100 条示范,GR00T-N1.7 从 64.1% 到 70.3%,离官方 3000 条示范的 70.8% 只差 0.5。π0.5 从 34.9% 到 41.4%,Others 类 +14.0。
| 设置 | 基线 | +INDI |
| Bridge / GR00T-N1.7 | 64.3% | 84.7% |
| Bridge / π0.5 | 52.3% | 58.8% |
| RoboCasa / GR00T-N1.7(100 条) | 64.1% | 70.3% |
| 真机三条件平均 | 62.0% | 68.7% |
真机四个桌面任务、每条件 50 次:ID 场景 71.0%→76.0%,留出物体 62.0%→68.0%,干扰物 53.0%→62.0%。长程更明显,Drawer Storage 在 ID 上 24.0%→36.0%。
对照把增益钉在意图上。同一条评测轨迹里,只加 grounding 或自由 latent 都低于动作基线;只要意图就能到 76.0%,完整 INDI 85.5%。把意图换成别的任务,成功率从对角 84.5% 掉到 45.2%;强制早/晚阶段内容则掉到 7.3% 和 5.5%。教师也不是随便换:Qwen3.5-9B 当教师会把成绩打到 54.5%,低于无蒸馏的 61.5%。
对已经在用 GR00T 或 π0.5 的人,这是训练期加监督、推理期几乎不加模块的改法。它比再预测一帧未来更对症:未来监督在 Bridge 上只吃到 +3.7,意图蒸馏吃到 +20.4。真机阶段分析也对得上:Cross-Bin Stacking 在取底座方块时两边差不多,差距出现在转向第二颗;多阶段任务更吃意图这种中间状态。
它仍是渐进改解码器,不是新的 VLA 骨架。教师质量和任务是否够长,会决定能不能复现那 20 个点。
正文没有独立局限节。Bridge 的头条数字被 EP-Basket 的 +60 点撑着,去掉它只剩 +7.1。真机短任务接近天花板,Basket Nesting 在干净场景甚至从 94.0% 掉到 92.0%。评测面是四个仿真任务加四个真机桌面任务,没有装配或移动操作。教师要看示范视频,换弱教师会伤策略。自由 latent 掉点,说明多出来的容量本身不是原因,但 mismatch 损失、上下文 dropout、不对称注意力绑在一起,论文没有把每条机制对真机的贡献拆开。