HARBOR 一个提示词全自动训练机器人运动策略,1.5 小时端到端

breadli428 · x · 2026-09-05

HARBOR 系统展示了完全自主的机器人策略训练流程:只需一条提示词,它就能在仿真器中自动构建任务、设计奖励函数、训练、调参并评估,端到端产出可用的 locomotion policy,全程约 1.5 小时。该项目已被 CoRL 2026 接收。作者感叹如今 prompting 一个 agent 就能在仿真器里完成 RL 运动策略训练,门槛大幅降低。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →