机器人策略自我改进:Q-Planning 让成功率 25% 升至 80%
rbhar90 · x · 2026-08-27
机器人从 demo 到落地难在数据:研究指出对机器人基础模型追加遥操作 SFT 数据因协变量偏移效果有限。Georgia Tech 等团队提出 Q-Planning:给一个冻结的大型视觉-运动 BC 策略外挂一个小型 off-policy Q 函数。
- 推理时 BC 策略采样 N 个候选动作块,Q 函数打分后做单步 Q 加权平均执行
- 成功与失败的 rollout 都进 replay buffer,只微调 Q 函数,BC 策略本身从不更新
- 效果:一个困难精细操作任务上,成功率从 25% 提升到 80%,约 100 次机器人尝试(约 30 分钟),无需额外人类演示
相当于给机器人策略加上类似"思考模式"的测试时计算自我改进能力。
所属事件:Q-Planning 让机器人策略自我改进,成功率从 25% 提升至 80%(2 条相关)→
「具身」频道最新
- 人形机器人百米跑进 8.86 秒,更惊艳的是镊子精细操作 — nordicinst · 2026-08-27
- Lumi 机器人亮相:旧金山组装,号称全球互动性最强 — Scobleizer · 2026-08-27
- 机器狗拿到自己的钱包:首个"有钱的机器人"开始撒币式传播爱 — adamamcbride · 2026-08-27
- 世界人形机器人运动会获好评:办得也太好了 — ezshine · 2026-08-27
- UIST 2026 研讨会征集:增强人类灵巧性与多感官反馈 — plopesresearch · 2026-08-27
- 为用 AI 杀蚊子,需将延迟压至 20ms — yacineMTB · 2026-08-27