HuGo 方法用 LLM/VLM 自动生成验证机器人策略,无需示范和奖励工程
m_wulfmeier · x · 2026-10-02
机器人学习的大多数精力花在收集演示或设计任务专属奖励函数上。HuGo 另辟蹊径:用 LLM 和 VLM 作为通用工具来生成和验证策略,不需要演示数据或奖励塑造,只需用语言定义新任务。
方法要点
- LLM/VLM 在高层生成指令,由 NVIDIA 的 SONIC 执行,底层由 RL 控制器完成
- 经过多轮 sim2real 与真实世界持续学习,数据效率显著
- 同一方法可开箱即用地迁移到真实世界适配(new task 不需重头设计)
作者 mwulfmeier 表示团队在做机器人足球时亲历了示范收集的痛苦,HuGo 是对此的直接回应,项目由 seoyeonchoi827 主导。
「具身」频道最新
- Shield AI 借鉴 Tesla 仿真路线,收购 Aechelon 剑指 AI 飞行员训练 — BrettKrieger12 · 2026-10-02
- OpenAI 送出 Codex Micro 实体设备,开发者晒开箱 — OpenAIDevs · 2026-10-02
- 博主看多特斯拉:Cybercab 注册量持续攀升,股价未反映进展 — JOBhakdi · 2026-10-02
- Rhoda 机器人已可高自主完成电子厂料盘拆包扫描码放等真实客户任务 — vincesitzmann · 2026-10-02
- IROS 最惊艳机器人演示:Digit 从箱中取物搬运,成功率约 80-90% — jonstephens85 · 2026-10-02
- 一个策略控 200+ 种机器人:通用运动控制策略 γ₀ 开放征集 — GeorgiaChal · 2026-10-02