比萨大学等用独立探索 critic 解决四足机器人推物的零奖励难题
stepjamUK · x · 2026-09-07
- 四足机器人推一个抓不住的物体是艰难的 RL 探索问题:接触发生前任务奖励始终为零,标准单 critic PPO 只会去优化平滑度和能耗惩罚,永远找不到接触。
- 来自比萨大学、ETH Zürich 与 NVIDIA 的成员提出训练一个单独的 exploration critic,基于密集的「寻找接触」奖励引导末端执行器走向候选接触点,再在训练中衰减其权重,使策略从找接触过渡到任务最优。
- 候选接触点来自通用抓取算法,因此可跨物体几何泛化、无需逐任务手工调整。
- 已在真实四足移动操作平台上验证搬运椅子,零样本迁移到未见过的 IKEA 家具,并能从失败接触中恢复。
「具身」频道最新
- AI 智能体穿线布缆重塑 PCB,人类只需反复说「弄到傻瓜都会」 — yacineMTB · 2026-09-07
- 真机器人演短剧第 3 集:Microduck 献上奥斯卡级表演 — huggingface · 2026-09-07
- $149 桌面设备 Harness:一个硬件调度 Claude Code 等所有编码 Agent — dee_hw · 2026-09-07
- DeepMind EXIMO 展示机器人模型「吃掉脚手架」的迭代循环 — m_wulfmeier · 2026-09-07
- 全国买不到 1.25mm 电池连接线?极客自制应急方案 — Saul_Loveman · 2026-09-07
- 华为 Mate XT 2 搭载麒麟 9050 Pro,芯片-系统-形态一体化成亮点 — CyberRobooo · 2026-09-07