Mistral 的 8B 导航模型只用单目 RGB,R2R-CE 达 77.4%
mistralai · hf · 2026-07-24
Mistral 发布了什么
Robostral Navigate 是一个 8B 视觉语言模型,用于机器人导航;它只看单目 RGB 图像流,就能在当前视野里预测下一步 waypoint。
这件事的意义
它刻意避开了深度传感器、多相机 rig 和预建地图,希望降低部署门槛,并尽量跨不同机器人形态通用。
训练方案
- 用 240 万 条轨迹、35 万 个仿真场景训练
- 采用 prefix-caching,把完整 episode 打包进单一训练序列
- 训练 token 数降低 22 倍,把训练时间从“月”级压到“天”级
- 使用 tree-based attention mask,防止模型偷看到历史 ground-truth 动作
- 再用强化学习提升探索和恢复能力
结果
- R2R-CE: 成功率 77.4%,比最强单目方法高 10.5 个点,也比最强深度/多相机系统高 5.3 个点
- RxR-CE: 成功率 75.1%,超过所有单目基线
结论
Mistral 在推动机器人导航走向“单摄像头、低成本、跨平台部署”的路线。
「具身」频道最新
- REK 在东京对战夜前放出武士机器人热身视频 — cixliv · 2026-07-24
- SAGE 生成可仿真 3D 场景并开源 1 万条具身数据集 — rsasaki0109 · 2026-07-24
- 清华团队用 AutoMIA 把两张图变成可 3D 打印的镜像错觉艺术 — 新智元 · 2026-07-24
- Black Forest Labs 称 FLUX 3 超越多款多模态对手并走向机器人 — Latent Space · 2026-07-24
- ReferTrack 用单摄像头跟踪自然语言目标,EVT-Bench 达到 89.4% — tencent · 2026-07-24
- IGGT4D 把流式 4D 实例几何带进动态场景理解 — zhenjun_zhao · 2026-07-24