HARBOR 一个提示词全自动训练机器人运动策略,1.5 小时端到端
breadli428 · x · 2026-09-05
HARBOR 系统展示了完全自主的机器人策略训练流程:只需一条提示词,它就能在仿真器中自动构建任务、设计奖励函数、训练、调参并评估,端到端产出可用的 locomotion policy,全程约 1.5 小时。该项目已被 CoRL 2026 接收。作者感叹如今 prompting 一个 agent 就能在仿真器里完成 RL 运动策略训练,门槛大幅降低。
「编程与Agent」频道最新
- tldraw复用record diff系统驱动动画引擎,几乎零管线成本 — max__drake · 2026-09-05
- 动画即diff回放:tldraw flash允许动画中途拖动形状 — max__drake · 2026-09-05
- tldraw flash下周发布:动画靠record diff,agent乱放isRecord是它的锅 — max__drake · 2026-09-05
- Databricks 高管:AI 编码市场双寡头将变三极,开源模型正在抢份额 — Yuchenj_UW · 2026-09-05
- Every 工程师用「文件夹即 Agent」方法跑 44 个专职 AI Agent — danshipper · 2026-09-05
- 开源 ffmpeg-skill:让 Claude Code 本地读懂自然语言剪视频 — TheMoonMidas · 2026-09-05