Dyna-1 叠餐巾 24 小时 99.4% 成功率:奖励模型如何补上机器人可靠性短板
AI Engineer · youtube · 2026-09-24
Dyna Robotics 联合创始人兼 CTO Jason Ma 在 AI Engineer 演讲中解释通用人形机器人从「视频好看」到「产品可用」的差距与方法:
- 80–90% 成功率是好视频、坏产品;Dyna-1 叠餐厅餐巾实现 24 小时连续作业 99.4% 成功率,甚至能从撞翻整摞餐巾后自主恢复。
- 核心是奖励模型:一个观察机器人并为其进度打分的模型,分数下降说明出错,团队据此定向采集恢复数据,在人机回路的主动学习循环中持续微调。
- 数据与架构:超过 20 万小时预训练数据金字塔;推理模型 + 世界动作模型的组合架构。
- 新任务冷启动:新任务可用不到 1 小时数据上线。
- 真实部署:餐厅与萨克拉门托自助洗衣店;在韩国 CoRL 现场无站点数据连续 3 天叠 T 恤,以及活动现场开红牛罐演示。
视频含完整时间戳,Q&A 涵盖为什么标准后训练卡在 80%、可扩展监督等。
「具身」频道最新
- 软体气动执行器改用 TPU-硅胶混合结构,行程提升 4 倍 — IanPritchard · 2026-09-25
- Waymo:2.71 亿英里无人驾驶,致伤事故比人类司机少 82% — reed · 2026-09-25
- HRI 2027 新设存档级工业白论文赛道,征集机器人落地实践 — petitegeek · 2026-09-25
- 高通 2nm 骁龙8至尊版发布:CPU 首破 5GHz,全线为智能体重写架构 — 量子位 · 2026-09-25
- Google 员工设想:用智能眼镜实时看见并「拍肩指挥」AI Agent — jason_mayes · 2026-09-25
- 用 iPhone LiDAR 做攀岩 3D 分析:开源视觉工具链解读 — dosco · 2026-09-25