Q-Planning 让机器人策略自我改进:Q 函数吃成败轨迹减少人工干预
micoolcho · x · 2026-09-18
RoboPapers 专访 Varun Giridhar3 与 Animesh Garg,介绍 Q-Planning 方法:模仿学习+人工干预推动了近期机器人进展,但通过针对性干预把策略调到可部署的成功率非常耗时耗力。
Q-Planning 的思路是从 pi-0.5 这类大策略出发,加一个 Q 函数估计器预测价值而非仅输出动作;在线利用成功和失败的 rollout 同时更新 Q 函数,再用它引导采样与轨迹选择。仅需少量 rollout 就能显著提升表现,让策略在没有人工干预的情况下自行改进。
所属事件:Q-Planning 让冻结机器人策略靠小 Q 函数自我改进(3 条相关)→
「具身」频道最新
- 麦当劳或是最适合部署机器人的餐饮连锁,时机成关键 — clemnt · 2026-09-18
- OpenHarness 开源:让编码 Agent 变成 CAD/机器人专家 — dee_hw · 2026-09-18
- STM32 机械手塞进五指:腱驱动关节加指尖压力与霍尔传感 — _Stocko_ · 2026-09-18
- 特斯拉 FSD 监督版已登陆 14 个市场,覆盖四大洲 — XFreeze · 2026-09-18
- Muse 模型上手实体机器人,控制 Earth Rover Mini 巡逻 — micoolcho · 2026-09-18
- Chris Paxton:没人要一台会打碎 1% 碗碟的 2 万美元家务机器人 — chris_j_paxton · 2026-09-18