腾讯发布具身多模态基础模型 RxBrain
jacek2023 · reddit · 2026-07-15
这个 HF 页面介绍了腾讯的 Hy-Embodied-RxBrain-1.0,一个面向具身认知的统一多模态基础模型。
它能做什么
- 具身理解与推理:对图像和多帧视频做问答与链式推理。
- 世界状态预测:根据动作想象物理世界里接下来会出现的画面。
- 联合子目标规划:把任务拆成步骤,并为每一步同时输出“下一步动作”和“目标图像”。
架构要点
- 采用交错生成:在同一个自回归序列里交替生成文本推理和想象帧。
- 用一个 <Image> token 决定何时进入“想象”阶段。
- 主干是约 6.2B 参数的统一 Mixture-of-Transformers (MoT)。
- 图像想象部分通过 flow-matching image head 解码到冻结的 FLUX VAE latent 空间。
作者强调的设计思路
它不是把理解、生成和规划拆成多个独立塔,而是试图让“说什么”和“世界应该长什么样”在同一序列里耦合起来。
「具身」频道最新
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11
- AUAR 推移动微型工厂:为每块木板定制生成机器人加工方案 — lukas_m_ziegler · 2026-09-11