τ(0)-VLA 用 4 万小时真机数据攻克长程机器人任务
机器之心 · wechat · 2026-07-27
这篇公众号长文解读了具身智能新模型 τ(0)-VLA,核心目标是让机器人从“会做动作”升级到“能完成任务”。文章认为,传统 VLA 更像反应式控制,而长程任务需要“慢思考+快执行”的分层架构:上层负责任务拆解、状态跟踪和规划,下层负责实时动作控制。
关键设计
- 引入 Test-Time Scaling 和世界模型推演,让机器人在行动前先预测不同方案的后果
- 高层规划由四个模块组成:候选任务生成、世界模型、价值评估、反思决策
- 形成类似束搜索的子任务级推理机制,专门处理物理世界中的链式影响
训练数据与规模
- 训练使用 40115 小时真实机器人交互数据
- 其中包含 2 万小时以上真机数据,覆盖多种机器人形态与公开数据集
- 低层动作空间统一为 40 维,通过 mask 适配不同本体
实验结果
- 在 AGIBOT G1 上,引入分层规划后,平均成功率从 27.5% 提升到 45.0%,平均任务进度从 80.10% 提升到 87.85%
- 在多项真实操作任务上,模型也表现出较强的直接执行能力,部分任务达到 10/10 成功率
文章的结论是:具身智能正在从短动作 demo 转向长程闭环执行,而“先想清楚再动手”可能是下一阶段的关键瓶颈。
「具身」频道最新
- 斯坦福 AI Lab 赞 NVIDIA Alpamayo 开放 Physical AI 平台 — StanfordAILab · 2026-07-27
- RoboDojo 在 42 个仿真和 18 个真实任务上评测 30 个机器人策略 — jiqizhixin · 2026-07-27
- Neuralink 未来展望:脑机接口或能彻底消除颈背疼痛 — DimaZeniuk · 2026-07-27
- 影石开源 PanoLOG:基于全景相机突破大规模 3D 重建瓶颈 — 机器之心 · 2026-07-27
- MotionBricks 提出模块化实时动作生成方法 — maier_ak · 2026-07-27
- 60 厘米人形机器人会做俯卧撑,网友更想要迷你版 — mrjonfinger · 2026-07-27