InterEvolve:用测试时奖励程序进化让人形机器人零重训学新任务
UIUC-CS · hf · 2026-10-02
UIUC 团队发布 InterEvolve,研究人形机器人 loco-manipulation 的测试时进化:让控制器解决从未训练过的新任务,无需重训练。
- 核心洞察:宽泛的基础控制器已具备新任务所需的大部分运动能力,关键在于规划与控制之间需要一个足够表达力、又可执行可度量的接口
- 方法分两块:一是 object-aware 的 forward-backward 行为基础模型,在冻结的身体先验上加物体残差,把新奖励变成测试时的操作行为;二是把任务写成「奖励程序」(带完成条件和可调常数的分阶段奖励),由 LLM agent 结合执行反馈与已验证程序技能库在上下文中修改结构,数值优化器调常数
- 每个候选程序在并行仿真场景中验证后迭代进化,可发现人类设计奖励未触达的新策略
- 在仿真中完成多任务、复杂场景和长程组合,进化出的技能可通过自研第一视角感知在真实 Unitree G1 上自主运行
「具身」频道最新
- 越狱 iPad 成功虚拟化 macOS,Xcode、FCP 原生跑上平板 — tom_doerr · 2026-10-02
- HIDE 基准揭示:机器人操作策略普遍缺乏部分可观测下的记忆能力 — Yansong Shi · 2026-10-02
- IROS 反应掉棒挑战:人类实测反应快过 Sharpa 人形机器人 — TinfoilTricorn · 2026-10-02
- 机器人抓取改用 Opus 写的代码控制,视觉对位精准插入后盖 — ihorbeaver · 2026-10-02
- AMD 收购 WorldLabs 背书 4D 路线,影身智能已携 2 亿订单落地制鞋厂 — 机器之心 · 2026-10-02
- 波士顿动力 Atlas 新手 GR3 仅四指:13 自由度的工业取舍 — xiaohu · 2026-10-02