Qwen 公开三项具身智能工作:导航、操作与世界模型
青稞AI · wechat · 2026-07-29
这篇公众号总结了通义千问团队在具身智能上的三项工作:Qwen-RobotNav、Qwen-RobotManip、Qwen-RobotWorld。
- Qwen-RobotNav:把 VLN、PointNav/ObjectNav、tracking、autonomous driving、EQA 等任务统一成 waypoint prediction,用 1560 万样本训练,并在多个导航 benchmark 上拿到结果,还做了 Unitree Go2 的 zero-shot 部署验证。
- Qwen-RobotManip:聚焦跨本体、跨动作空间的通用操作模型,使用约 3.81 万小时操作语料训练,在多个 OOD generalization、instruction following 和 cross-embodiment benchmark 上表现突出。
- Qwen-RobotWorld:做的是语言条件的具身 world model,不直接输出低层控制,而是预测未来视觉状态;训练数据覆盖 860 万 video-text pairs、2 亿+ frames、20+ embodiments、500+ action categories。
文章的共同结论是 “Alignment unlocks scaling”:具身智能的瓶颈不只是数据和参数规模,更是机器人本体、动作空间、相机几何、历史观测和语言指令之间的结构对齐。
「具身」频道最新
- 天工机器人跳 2.88 米破纪录,人形机器人秀仓储打包 — chris_j_paxton · 2026-08-25
- 曝 Apple M6 本地 AI 跑分暴涨 4.8 倍,支持 70B 模型 — kimmonismus · 2026-08-25
- 人形机器人百米跑 9.39 秒,逼近博尔特纪录 — heyshrutimishra · 2026-08-25
- 苹果推 M5 Ultra 版 Mac Studio,内存飙至 512GB — themixtergames · 2026-08-25
- 机器人行业展望:明年智力不再瓶颈,产能成关键 — Rewkang · 2026-08-25
- Matic 机器人翻车:面包扎带卡进吸尘管道 — tristanbob · 2026-08-25