Towards Predictive, Aligned, and Scalable Robot Learning
Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang
cs.RO, cs.AI
2026-07-13
Lumo-2 反驳『动作重建越准控制越好』,用隐式世界动态分阶段对齐动作/视觉/语言,长时序和灵巧任务上明显超过 π0.5、Fast-WAM。
给机器人装「大脑」的视觉-语言-动作(VLA)模型,主流做法是把摄像头画面、语言指令和要输出的机械臂动作 token 化,一起喂进一个 Transformer 学。瓶颈卡在「动作」这一路:常用做法是把连续动作要么直接当信号、要么用重建损失训练的 tokenizer 离散成 token,目标是把动作信号还原得越准越好。问题在于,重建得准和下游控制得好不是一回事:为低层信号保真度优化的动作表征,跟实际控制需要的几何结构对不齐。再加上动作要同时回应画面(含大量无关变化)和语言(抽象语义),三类模态直接一起训,容易训不稳、收敛慢、泛化差。
Lumo-2(Astribot 团队)要解决的就是这条动作表征与控制之间的错位,顺带把多模态对齐做得更可控。
核心是一个「隐式世界动态」(latent world dynamics)表征,记作 φ。它从两帧观察里蒸馏出「动作会引发的、与未来相关的物理变化」,不去预测逐像素的下一帧画面。作者的中心假设是:动作生成质量由隐空间的几何结构决定,重建损失会把表征带偏,所以要把动作表征逐步对齐到世界动态、视觉、语言上。
具体分三阶段预对齐。
阶段一,动作对齐隐式世界动态。用双分支的向量量化(VQ)架构,视觉和动作各一条自编码分支,同时训练,并强制视觉特征参与到动作重建里(â = DA(A, φ))。训练数据是 Astribot S1 采集、跨本体数据和第一人称人类视频的混合,3 万步,batch 24,64 张 H100。
阶段二,动作对齐视觉和语言。引入 Qwen3.5-4B 做骨干,加一个语义提取模块,用一组多任务目标(动作重建、行为理解、视觉-语言引导的动作生成、跨模态预测、跨模态对比)把动作 token「语义化」,词表扩了 32 个视觉上下文 token 和 1024 个语义动作 token。1.2 万步,64 张 H100。
阶段三,在 VLM、视频、机器人数据上协同训练。VLM 数据集约 5300 万样本,强调定位、认知、规划。推理用「分块自回归」(Block-wise Autoregression, BAR),把原来 32 步的逐 token 生成压成 4 步分块并行,端到端时延从 253.66ms 降到 93.53ms,约 2.71 倍加速。12 万步,160 张 H100。
先看世界动态表征本身有没有学到「与未来相关的物理信息」。给模型看初始观察帧,让它预测任务指令是什么:只用初始帧的 DINO 特征,准确率 43%;加 4 帧未来观察,94%;而用初始帧 + 隐式世界动态 φ,达到 90%,接近完整观察的水平。这说明 φ 确实压缩进了与未来相关的语义。
VLM 能力上,以 Qwen3.5-4B 为基线,Lumo-2 在几个空间理解基准上明显抬升:
| 基准 | Qwen3.5-4B | Lumo-2 |
| VSIBench | 21.73% | 52.34% |
| Where2place | 55% | 74% |
| MMSI | 30.8 | 36.4 |
真实机器人任务套件是核心卖点:22 个有难度的操作任务、6 个类别,在 Astribot S1 上和 π0.5、Fast-WAM 对比。需要时序推理的任务上,Lumo-2 明显领先:从传送带捡鸡蛋成功率 100%(纯 VLA 微调 92%);把方块放到旋转架 81.67%(VLA 74.17%)。长时序任务上差距更大,做咖啡、调鸡尾酒相比两个基线有大幅领先,Fast-WAM 在调鸡尾酒上直接 0%。物理理解类(摊鸡蛋、钉钉子)里,Fast-WAM 在摊鸡蛋上完全失败,Lumo-2 稳定完成。灵巧操作 7 个任务上全部最优。
对做具身智能的人来说,这是一份「动作表征不能只靠重建」的实证。它把一个常被默认的假设(动作 token 化按重建精度优化就好)摆出来反驳,并用一套分阶段对齐的工程方案把动作、世界动态、视觉、语言逐步拧到同一个几何结构上,落点在控制质量而非信号保真度。BAR 推理把分块自回归做到近 3 倍加速,对实机控制这种对时延敏感的场景很实用。
也要说清,这是一篇偏工程系统的论文,主要价值在能跑通且效果强的完整方案,而不是单个可单独取用的模块。
这篇没有独立的局限章节,结构是相关工作、结论、贡献。结合全文,几处存疑要标出:真实任务全部在 Astribot 自家的 S1 平台上评测(单一本体),基线 π0.5 和 Fast-WAM 也在作者自己的设置里跑,样本只有 22 个任务、每类仅个位数,数字要谨慎读;「人到机迁移」(用 VisionPro 和第一人称视频示范)是定性展示,没给成功率对照;φ 的探测准确率(90% 对 94%)是代理指标,不是任务成功率;阶段三用了 160 张 H100,算力门槛对多数团队不现实,可复现性存疑。