HuGo 方法用 LLM/VLM 自动生成验证机器人策略,无需示范和奖励工程

m_wulfmeier · x · 2026-10-02

机器人学习的大多数精力花在收集演示或设计任务专属奖励函数上。HuGo 另辟蹊径:用 LLM 和 VLM 作为通用工具来生成和验证策略,不需要演示数据或奖励塑造,只需用语言定义新任务。

方法要点

作者 mwulfmeier 表示团队在做机器人足球时亲历了示范收集的痛苦,HuGo 是对此的直接回应,项目由 seoyeonchoi827 主导。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →