Qwen-RobotManip:对齐先行,解锁机器人操作模型规模化
rsasaki0109 · x · 2026-09-03
论文提出 Qwen-RobotManip,一个基于 Qwen-VL / Qwen3.5-4B 的通用视觉-语言-动作(VLA)操作基础模型。架构上由视觉语言骨干 + flow-matching Diffusion Transformer 动作专家组成,可在保持感知与语言对齐的同时生成连续动作。
核心主张是「对齐先于规模」:机器人操作数据天然异构(本体、动作空间、相机系统、坐标系、采集流程、任务分布各不相同),模型提出覆盖表示、运动、行为的统一对齐框架,使多源数据训练协同而非冲突。仅用开源数据集和第一视角数据训练。
「具身」频道最新
- 开源陪伴机器人 Autonomous Lamp 售价 499 美元,带 70+ 技能商店 — dee_hw · 2026-09-03
- 研究显示在线 RL 中动作分块同样显著提升 Contrastive RL 表现 — ben_eysenbach · 2026-09-03
- WRC 2026 观察:人形机器人转向行业方案,触觉灵巧手成标配 — CyberRobooo · 2026-09-03
- AM-ARM200 开源机械臂:1kg 负载全 3D 打印,全套约 380 美元 — RemiCadene · 2026-09-03
- Cybercab 进欧洲?欧盟已有无人车审批法规,爱尔兰还缺落地规则 — Graham_dePenros · 2026-09-03
- Nvidia 将 RTX Spark 带入欧洲,桌面端本地 AI 工作站落地 — nordicinst · 2026-09-03