Qwen-RobotManip:对齐先行,解锁机器人操作模型规模化

rsasaki0109 · x · 2026-09-03

论文提出 Qwen-RobotManip,一个基于 Qwen-VL / Qwen3.5-4B 的通用视觉-语言-动作(VLA)操作基础模型。架构上由视觉语言骨干 + flow-matching Diffusion Transformer 动作专家组成,可在保持感知与语言对齐的同时生成连续动作。

核心主张是「对齐先于规模」:机器人操作数据天然异构(本体、动作空间、相机系统、坐标系、采集流程、任务分布各不相同),模型提出覆盖表示、运动、行为的统一对齐框架,使多源数据训练协同而非冲突。仅用开源数据集和第一视角数据训练。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →