A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world
Steeven Janny, Leonid Antsfeld, Christian Wolf
ECCV 2026 European Conferenc
cs.RO
2026-06-19
NaverLabs在真实办公楼跑完966次、共24公里点目标导航。冻结ViT经空间瓶颈后,每图像块一个标量仍有约95%真实成功率;视觉从零跟RL一起训,仿真成功率只有53.5%。
端到端导航现在几乎都在吃预训练视觉编码器,但很少有人在真实楼里、以接近步行的速度,把「该用哪套视觉、特征要留多少」跑成可比较的表。仿真里换 backbone 很容易,sim2real 一放大,排名经常翻盘。
NaverLabs Europe 把问题收窄到静态点目标导航:出发时给一个相对极坐标目标,之后这个向量不再随机器人移动更新。部署只用前置 RGB,不用激光雷达和深度相机,最高线速度 0.7 m/s,决策频率 3 Hz。真机是一栋办公楼里的 Rookie 机器人,共 966 个 episode、合计 24 公里;仿真侧用改过动力学的 Habitat,在 HM3D 验证集上评 2500 个 episode。
策略骨架来自同一组此前的工作。冻结 ViT 抽特征,可训练投影头压维,两层 GRU 记状态,PPO 更新。动作是 28 个离散速度对,线速度取 {0, 0.2, 0.4, 0.7} m/s。奖励是到达奖 2.5、测地距离下降、每步 0.01 的时间惩罚、碰撞罚 0.1 但不终止。仿真不用 Habitat 默认的瞬移动作,改成真机辨识出的二阶动力学:3 Hz 下一次纠错最早要等 333 ms,惯性必须进模型。
对照的编码器包括 DinoV2、DinoV3、面向机器人数据的 VC-1(MAE,4.3M 图加 4000 小时自我中心视频),以及两个多教师蒸馏模型 AM-RADIO(CLIP + DinoV2 + SAM)和 DUNE(DinoV2 + MASt3R + 人体网格)。从零训练的对照是半宽 ResNet-18,整网跟 RL 一起训。
投影头才是这篇真正动手的地方。常规是 cross-attention pooling(CAP):K 个可学习 query 去 attend ViT token,值和注意力一起交给策略。他们提出 Pure Attention Projection(PAP),扔掉 value 投影,只把 softmax 后的注意力分布本身当作特征。每个 query 吐一张空间热力图,策略看到的场景信息就只有这些图,外加轮式里程计。另外还试了逐 patch 线性降维(LPR)和 PCA。
训练分两条线。一条是投影头和策略从零训 5 亿步。另一条先用 360° 类激光扫描在仿真里训 8.5 亿步,再把视觉接上去微调 1 亿步。特权传感器只出现在训练,部署仍是纯 RGB。
视觉从零训,仿真成功率只有 53.5%。接上冻结 ViT 之后,数字立刻拉开。
| 编码器 | 仿真 SR | 真实 SR |
| ResNet 从零 | 53.5 | 未测 |
| DinoV2 | 63.4 | 64.3±5.8 |
| VC-1 | 86.3 | 95.2±6.7 |
| DUNE | 90.7 | 95.3±3.3 |
| AM-RADIO | 85.2 | 100±0.0 |
| DinoV3 + CAP | 0.0 | 未测 |
真实侧每组 3 次 × 14 条路径。多教师蒸馏的 AM-RADIO 和 DUNE 在真机上最稳;通用 DinoV2 明显落后。DinoV3 配 CAP,三个随机种子全是 0。
先用类激光策略预训练再微调,多数编码器仿真 SR 升到 87%–90%,真实 SR 到 93%–100%。DUNE 真实 SCT 从 26.8 升到 30.1。AM-RADIO 是例外,微调后真实 SR 从 100 降到 92.9。特权激光本体真实 SR 仍是 100、SCT 36.5,视觉还没追上。
PAP 把信息压到每 patch 一个标量(K=1)时,DinoV2 真实 SR 仍有 92.9;K=2 时真实 SR 到 100。CAP 用 K=1 也能到真实 97.6,但热力图不再是策略看到的全部。PCA 丢掉空间结构后,DinoV2 仿真 SR 掉到 51.5 和 29.7,AM-RADIO 接近 0。DinoV3 只有 PAP(K=8,真实 SR 95.3)和 LPR 能救回来,CAP 怎么改 K、换成 ViT-S 都是 0。
热力图里会自己长出可通行方向、障碍和「下一步能走哪」的 affordance,而且仿真渲染和真机相机对准同一视角时,注意力落点接近。
给做具身导航的人三条能直接用的结论。视觉不要从 RL 信号里现学,预训练编码器加上真实惯性的仿真,sim2real 可以被压到仿真表和真机表能对上看的程度。通用自监督不一定是机器人最优解:VC-1 的机器人数据配比、DUNE 和 AM-RADIO 的多任务蒸馏,都比 DinoV2/V3 好用。策略真正需要的空间信息可以少到每 patch 一个数;PAP 这种故意变笨的瓶颈,在 DinoV3 这种 CAP 完全解不动的特征上,反倒成了唯一能用的读出。
这不是新 backbone 论文,是把「编码器 × 投影 × 特权预训练」在真机上打穿的对照实验。渐进,但数字是真机上的。
真实评估只在一栋办公楼,每组 14 条路径,成功半径放到 1 m,仿真是 0.2 m。车上仍有轮式里程计和 IMU 提供相对起点的位姿,不是纯视觉定位。附录写明:靠近目标 2 m 会重置隐状态并重新喂目标;车上 2D 激光用于防撞安全层,不进策略,训练时模拟了这层保护。仿真 SR 低于 60% 的模型直接不送真机,DinoV3 配 CAP 的失败因此没有真实数字。
任务也窄:静态点目标,没有语言、没有图像目标,动态障碍不是主设置。论文把 sim2real 说成可忽略,依据是两边指标量级接近,但成功半径、安全层和重置协议并不对称。DinoV3 失败被归因于 CAP 太复杂、弱奖励解不出特征,这是事后解释,没有把特征频谱或探针实验做死。