VIScore: Diagnosing Planning-Relevant Quality in Latent World Models
Haiyu Wu, Randall Balestriero, Morgan Levine
cs.RO
2026-08-12
VIScore 从预测保真、动作影响、搜索清醒三因子给潜在世界模型打分,跨任务 Spearman 相关最高、校准最稳,单次约 7 秒。
JEPA 式潜在世界模型(如 LeWorldModel,简称 LeWM)在一个低维潜在空间里预测未来,再用搜索式规划器(model-predictive control 配 CEM)在这个空间里找动作。训练时靠正则项 SIGReg 把潜在空间拉成各向同性高斯,防止表征坍缩。但「潜在空间正则得好不好」和「规划成不成功」一直是脱节的。已有的诊断指标要么看轨迹直不直(straightness),要么看潜在状态里有没有物理量(physical-state probing),要么看动作能操控多少未来(empowerment),它们都只盯编码器吐出的潜在向量,没看预测器和规划器在干什么。
作者先用一个对照实验确认这个脱节是真的:把 LeWM 里的 SIGReg 换成目标相同但结构不同的 VISReg,发现对自监督学习(SS)有利的正则性质不会搬到规划上,而分布匹配做得更细反而能提升分布外(OOD)规划的成败。这就逼出了真正的问题:到底哪些因子和规划成功率相关。
VIScore = Veracity × Influence × Sobriety,三个因子分别盯预测器、动作与潜在的关系、规划器。
三因子相乘,意味着任一环节崩盘都会拉低总分。三个探针合起来在单张 H100 上约 7 秒一个 checkpoint,而一次 50 回合的规划评测至少慢 20 倍、还要多两个数量级的预测 rollout 步。设计的取舍在于:每个因子只覆盖一个环节(编码器的影响通过 Influence 间接进来),所以低分能告诉你瓶颈在哪。这是个诊断仪表盘,不是又一个刷榜模型。
评估用 Spearman 相关(指标能不能正确给 checkpoint 排序)和校准误差(指标的数值能不能跨任务比较)两个口径,在四个设置上比 straightness、physical-state probing、empowerment。
| 设置 | VIScore 池化相关 | 次优指标 | 校准要点 |
| 开发集 | +0.88 | probing +0.77 / empowerment +0.40 | VIScore 10.2 < 常数基线 24.4 |
| 留出 checkpoint | +0.91 | empowerment +0.49 | VIScore 7.0 < 18.2 |
| 留出方法(Qantara 等 4 个) | +0.75 | empowerment +0.12 | 差距最大的设置 |
| 留出数据集(MAZE) | +0.87 | empowerment +0.87 打平 | empowerment 校准 9.2 反而更优 |
论文反复强调的核心结论:VIScore 是唯一在全部四个设置里校准误差都低于常数基线的指标。empowerment 在前三个设置里也低于常数,但在「留出方法」上以 12.0 越过 11.3 的基线失效,而那恰好是 VIScore 优势最大的设置(+0.75 对 +0.12)。留出数据集 MAZE 是 VIScore 唯一没拿全胜的场景:相关和 empowerment 打平,校准还略输,因为 MAZE 的 empowerment 中位数只有 20.3 nat,远低于 82 的上限,Influence 因子完全没饱和、几乎不带区分度。
因子消融显示没有单一因子通吃:开发集靠 Sobriety(+0.89)领跑,留出方法靠 Veracity(+0.62)和 Sobriety(+0.68)撑场,Influence 要到 MAZE 这种容量远未饱和的池子里才变得关键。作者再把 VIScore 换到 6 个规划器上(CEM、MPPI、iCEM、predictive sampling、多起点与单起点梯度下降),池化相关全部为正(CEM/MPPI +0.81、iCEM +0.87),说明它不绑定某一种搜索算法。
SIGReg→VISReg 的对照还给出一个不太舒服的结论:VISReg 在 OOD 形状上的提升和 batch size 缠在一起。同样 batch=128 时,VIS-WM(77.4)其实略低于 SIGReg 的 LeWM(79.1);VISReg 的优势要到 batch=512(82.0)才显现。附录里讲清了原因:VISReg 的排序分位 shape 项有个 1/log B 量级的有限样本底,得靠大 batch 才能把分布匹配做细。
对做世界模型的从业者,这是个便宜的排序与归因工具。选 checkpoint、调正则时,与其反复跑几十回合规划评测,先用 7 秒的 VIScore 筛一遍,还能看出瓶颈卡在预测器、动作控制力还是规划器钻空子上。论文顺带给的方法论警告也值钱:单种子评测会夸大改进,SS 里管用的正则性质不会自动搬到规划,这两条会让不少「换了正则、涨了点」的结论站不住。
要强调它不是什么:它不替代真正的规划评测,也不预测绝对成功率。VIScore 高不保证成功,低不保证失败,它是诊断不是回归。
作者自己列了几条。一是只适用于带预测器的搜索式规划器;amortized planner(直接出动作、没有显式预测器)整套不适用,诊断工具还是空白。二是 Influence 假设预测器在 1 步和 H 步上犯错的方向近似稳定,如果误差方向会旋转,H 步的噪声底分配就会错。三是 OGBench-Cube 上 gripping 成败是个离散事件,VIScore 测不到,而且这里 memp 高达 236 nat 远超 82 上限,Influence 对每个 Cube checkpoint 都恒等于 1,没有区分度。四是多任务规划、无动作标签训练这些场景还没碰。
另有两点作者没充分验证。第一,SIGReg 的 OOD 优势基本是靠 batch size 换来的:等 batch 的对照里 VISReg 反而略输,所以「换 VISReg 就涨 OOD」得带上「并加大 batch」这个前提才成立。第二,留出数据集 MAZE 上 empowerment 在校准上赢了,VIScore 的全胜并不彻底;论文标题级的「唯一全面低于常数基线」靠的是 empowerment 在留出方法上那 0.8 的微小越界,这个 margin 不算结实。