WALL-SS 闭环仿真与真机成功率相关 0.93,插入段仍偏乐观

WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression

Maeve Zhang, Rain Sun, Xiang Wang, Cyril Zhang, Shalfun Li, Meng Cao, Howard Lu, Ethan Chen, Harry Jhou, KZ Zheng, Lights Shi, Regis Cheng, Lorenzin, Robert Wang, Victor Yao, Gody Li, Elise Mon, Yohann Tang, Ryan Yu, PS Zhang, Vincent Chen, Hang Su, Roy Gan, Hao Wang, Qian Wang

cs.RO

2026-08-27

自变量把 InfinityStar 做成动作条件的 next-scale 世界模型 WALL-SS。60 秒流式滚动里轨迹误差低于画面对角线 0.5%;600 次闭环对照中仿真与真机成功率相关 0.93,接触插入仍偏乐观。

这篇在解决什么

现有机器人世界模型大多还是 clip 级视频生成:一次吐出固定时长的未来画面,动作只是附加条件。clip 之间怎么传状态、怎么按奖励改动力学,通常另接一套接口。动作和后果的对应关系没有写进生成过程的因果顺序里。

一旦要做分钟级滚动、闭环评策略,这套接口就散了。自回归每次把生成画面写回上下文,误差会沿物体身份、接触结果和动作历史一起漂。自变量机器人的 WALL-SS 要做的,是把动作条件、有界记忆和奖励优化收进同一套 next-scale 生成过程。

方法

视觉生成器从 InfinityStar 初始化。每一段未来画面按尺度从粗到细自回归:先定整体布局和接触关系,再补残差细节。动作不是全局 prompt,而是按尺度对齐的条件 token。当前尺度只看到对应时间窗、对应相机的控制,看不到未来动作,也看不到其他视角的控制。

三条配套设计钉在同一套尺度层级上。

数据以 AgiBotWorld-Beta 全量为主,约 100 万条轨迹压成 98.7 万条带字幕 clip,来自 16.6 万源视频。再加私有双臂数据和 UMI 手持夹爪。关键的一块是接管与失败恢复:现场接管,以及回滚到出错前再重放正确分支。目的是打破「夹爪一合物体就吸上来」的捷径。

结果

WorldArena 协议的具身视频生成(200 条分布内 + 100 条 OOD,80% 带动作)里,物理相关指标拉开得最明显。图像质量仍低于 CogVideoX-5B 的 0.718。

方法轨迹精度动作跟随交互质量指令跟随图像质量
InfinityStar0.2510.4840.4060.602
Wan2.2-14B0.1590.4760.3940.690
Cosmos3-Nano0.2020.0440.5160.4100.693
WALL-SS0.5390.2900.5460.4710.697

60 秒流式倒水滚动中,接触段逐帧轨迹误差低于画面对角线的 0.5%。论文用图对比了去掉 dream forcing、只留最近 clip、全量 KV 三种记忆变体,正文没有给出这些变体的单一标量。

奖励对齐相对纯监督检查点:动作跟随 0.264→0.290,轨迹精度 0.512→0.539,clip 边界误差 0.118→0.104。外观指标在评估噪声内不动。同一动作专家接到对齐后的视觉状态,真机 Task Progress 从 64.6 升到 69.1。奖励本身看不见动作、进度或成败。

闭环评策略更硬。5 个 WALL-WM 检查点放到 6 个任务、各 20 个匹配初始状态上,仿真和真机各跑一遍,共 600 对。成功率相关 r=0.93;30 个任务-检查点格子的 MAE 为 0.062,偏差 +0.028,校准斜率 0.84。任务内两两排序保住 89%(59 对未平局),平均 Spearman 0.88,选错最好检查点的 regret 均值 0.025。600 对里 527 对结局一致,平衡准确率 0.88。乐观误差集中在接触:插入转移偏差 +0.12;332 次真机失败里有 45 次仿真仍判成功,假阳性率 0.14。

真机桌面双臂的平均 Task Progress 为 69.1,对照 π0.5 的 49.6、DreamZero 的 44.1、LingBot-VA 的 34.0。按按钮顺序 63 对最好基线 31,形状分类 80 对 55。

为什么重要

从业者真正要的不是更好看的机器人视频,是一个能拿来筛策略检查点的仿真器。0.93 的相关和 89% 的排序保住,说明这条路走到了「排 checkpoint 大致靠谱」的位置。接触插入仍偏乐观,弱检查点会被抬高。

next-scale 自回归给出了显式似然,奖励才能直接打在视觉 token 上,不必另接一套扩散 RL 接口。对已经在用视频世界模型做策略评估的团队,这篇更接近一份配方:动作按尺度对齐、记忆按尺度压缩、奖励只打动力学保真。

真机对照用的是自家 WALL-WM 检查点和桌面双臂。换别人的本体和策略族,数字要打折。

局限与存疑

论文没有独立的 Limitations 节,讨论停在「从外观生成走向可复用的交互理解」。能从实验读出的缺口更具体。

接触和插入是系统性乐观,不是噪声。校准斜率 0.84,弱检查点被抬高。每格只有 20 次,作者自己说不要过度解读格子差异。

评测面偏内部。视频基准来自自家数据混合物,闭环策略是 WALL-WM,真机是自家桌面双臂。π0.5 等基线只保证了相同任务定义、观测和评分量表,训练数据是否对齐没有写清。模型参数量正文没给,定性图里骨干写成 Infinity-8B。私有数据和接管数据的规模也没量化。60 秒叫分钟级,远不是班次级作业。奖励对齐故意从强监督检查点出发、用 KL 拴住,增益按设计就是修残差。

术语

原文与代码

社区讨论

相关论文

全部论文解读