RISE: Adaptive Imagination for World Action Models
Hongbo Lu, Liang Yao, Chenghao He, Hao Han, Fan Liu, Wenlong Liao, Tao He, Pai Peng
cs.CV
2026-08-20
RISE 用风险和规划增益逐步决定还要不要想象未来。NAVSIM v1 规划分 91.5、v2 为 90.8,平均只滚 2.4 步,调度器还能插到别的世界动作模型上。
World Action Model 会先想象未来再规划动作,但现有方法给每个场景固定一份想象预算。空旷直路多想几步只会加延迟,路口交互少想几步又会漏风险。RISE 认为缺的是逐步重估的停止信号:当前前缀够不够规划,再滚一步值不值。
RISE 是 Encoder–Predictor–Planner 上的插件调度器,由 Latent Evaluator 和 Rollout Gate 组成。每一步 Evaluator 输出已经暴露的风险轮廓,以及继续 rollout 相对当前前缀的 Future Planning Gain。Gate 拿这份增益对计算代价,做 Roll/Stop。Roll 就再生成一帧未来潜变量;Stop 就把选中的前缀交给 Planner。有效视野从 0 步到数据集上限,由反复二值决策长出来,不是事先选一个深度。
监督分两路。全视野规划分数给出增益标签。真实日志只有一条已发生的未来,安全关键的反事实很少,于是另造 CounterDrive:用 Wan 2.7 从 NAVSIM 和 nuScenes 关键帧生成 10 秒 1080p 反事实视频,经专家核验轨迹有效性、事故起点和因果类别。过滤后 nuScenes 有 2432/511 训测片段,NAVSIM 有 5013/1000。训练分三阶段:先训预测器和可变前缀规划器,再学风险和增益,最后把 Gate 训成代价感知的停止策略。默认代价权重 λ=0.005,NAVSIM 最大视野 4 步、nuScenes 3 步。编码器是冻结的 V-JEPA 2 ViT-L。
NAVSIM v1 上 PDMS 91.5,高于 DriveFuture 的 90.7;v2 上 EPDMS 90.8,高于 DriveFuture 的 89.9。nuScenes 平均 L2 0.31 m、碰撞率 0.10。调度器单独把 PDMS 从 89.7 拉到 91.2,CounterDrive 单独到 90.5,合在一起 91.5。相对随机停止和潜变量收敛停止,调度器平均 rollout 2.40 步、延迟 287 ms、EPDMS 90.8,后两者分别是 89.5 和 89.7。固定深度并不普适:1248 个场景零步最好,4036 个场景三步最好;零步组加深到 4 步会把 EPDMS 从 89.9 降到 88.4。接到 DAWN 上不改预测器和规划器,PDMS 从 89.1 到 90.3。无 CounterDrive 时风险排序接近随机,AUC 约 0.49–0.52。该评测走感知-free 设定。
| 方法 | NAVSIM v1 PDMS | NAVSIM v2 EPDMS |
| DriveFuture | 90.7 | 89.9 |
| EponaV2 | 90.4 | 88.9 |
| RISE | 91.5 | 90.8 |
自动驾驶里想象有用,但不该按架构写死预算。把「再想一步能涨多少规划分」变成逐步门控,质量差不多还能少滚几步。调度器能插到别的 WAM 上,说明这是计算分配,不是某一套骨干的私货。CounterDrive 把风险排序 AUC 从约 0.5 拉到 0.93–0.96,对安全向世界模型是可复用的数据资产。增益幅度是 0.8–0.9 个 PDMS 点,属于规划基准上的渐进改进。
实验只在驾驶上,作者自己也说还没验证到其他具身域。CounterDrive 没有一对一覆盖 NAVSIM 训练集,反事实视频经 Wan 生成再人工过滤,分布和真实事故仍有缝。NAVSIM 最大视野只有 4 步、nuScenes 3 步,自适应空间很窄。主表相对最强基线的领先不到 1 分,没有报告统计显著性。感知-free 设定和真实车上的时延、闭环控制还有距离。