RynnBrain 1.1:122B-A10B 具身基础模型,空间感知多项超闭源

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

cs.RO

2026-07-20

覆盖 2B/9B/122B-A10B 的具身基础模型原生输出三维定位和抓取点;122B 版在 VSI-Bench 等空间基准超所有闭源,还发现具身预训练能把推理任务的「越缩越差」扭成「越缩越好」。

这篇在解决什么

通用多模态大模型在图文问答上已经很强,但真机系统额外要求理解三维结构、跨视角推理、把语言指令落到物理位置、并为下游机械臂策略当好初始化。直接拿通用 VLM 训 VLA(视觉-语言-动作模型)效果不好,因为缺物理先验。RynnBrain 1.1 要回答两个问题:模型的表示和输出怎么更贴近机械臂操作?这种模型当 VLA 后训练的初始化到底有多大用?

方法

统一时空加物理接地的框架,decoder-only 架构(视觉编码器加投影器加 Qwen3.5 系列骨干),三个尺度 2B、9B、122B-A10B 共用同一架构和训练配方,方便做 scaling 研究。语义推理和空间定位一起学,不靠分离的预测头。

相对 1.0 的两处关键改动。一是抓取表示从抓取矩形换成接触点 (p, θ),p 是抓取中心、θ 是夹爪角度;矩形表示假设一个物体有唯一正确抓取框,但实际上一组功能等价的抓取都对,矩形对不上动作接地。二是 2B 和 9B 原生三维接地:直接预测三维框(中心、尺寸、朝向),靠训练时大量三维建模,单图就能做物理接地推理。

训练数据分几类:通用 MLLM 数据、多维认知(物体、空间、计数、OCR)、时空定位、三维接地数据、接触点数据、物理感知规划数据。团队还做了视角条件渲染和投影管线,把仿真抓取标注转成可靠的二维监督,过滤太近、太远、截断或视觉模糊的视角。模型输出统一的多模态集合:文本、框、点、轨迹航点、三维感知、接触信号。

结果

具身认知基准:

基准RynnBrain 1.1对照
VSI-Bench (122B)75.0超所有闭源与开源
RefSpatial-Bench (122B)79.1Gemini 3 Pro 65.5
MindCube (9B)86.9RynnBrain-8B 56.6(+30.3)
MMSI (9B)47.0Qwen3.5-9B 13.4

三维接地:9B 在 WildDet3D-Bench 上 AP3D 23.44,超过专门的 WildDet3D 检测器(22.6);SUN RGB-D 上 9B 达 AP@15 41.12,对照 Gemini Robotics-ER 48.3。

scaling 的核心发现是三个 regime:通用认知两边都单调涨;推理密集型任务上 RynnBrain 1.1 稳涨(+38.6%),而 Qwen3.5 反向 scaling(-39.2%);定位任务两边都大幅涨。结论是:推理任务上具身预训练决定了 scaling 是帮还是害,它把纯 VLM 缩放下会退化的一项能力变成稳定受益。

真机上,三个长程任务各 20 次试验,RynnBrain-VLA 平均成功率 86.67%,超过 GR00T N1.7(73.33%)和 π0.5(65.00%)。跨本体泛化版 VLAGeneralist 平均成功率 91.67%,超过单独微调的单任务策略。

为什么重要

给做具身智能的人一个证据:别指望通用 VLM 缩放能顺带把空间推理带起来,具身预训练这一步绕不过去。接触点和三维接地的统一输出,也让下游机械臂策略少接一个专门的三维检测器。模型三档全开,2B 和 9B 能本地跑,适合做基线对比和二次开发。

局限与存疑

原生三维接地只在 2B 和 9B 上给,122B 没有。接触点预测没有公认的评测指标,论文自己说难评功能有效性。三维接地依赖相机内参输入。接触点是动作接地接口,不是完整可执行抓取(深度、接近方向、夹爪开合、碰撞、运动学都交给下游策略),所以「端到端」是过誉的说法。WildDet3D 合成数据继承了单目升维的残余噪声。论文没有独立的局限章节,上面的局限是从正文和评测困难里读出来的。

术语

原文与代码

相关论文

全部论文解读