机器人策略自我改进:Q-Planning 让成功率 25% 升至 80%

rbhar90 · x · 2026-08-27

机器人从 demo 到落地难在数据:研究指出对机器人基础模型追加遥操作 SFT 数据因协变量偏移效果有限。Georgia Tech 等团队提出 Q-Planning:给一个冻结的大型视觉-运动 BC 策略外挂一个小型 off-policy Q 函数。

相当于给机器人策略加上类似"思考模式"的测试时计算自我改进能力。

所属事件:Q-Planning 让机器人策略自我改进,成功率从 25% 提升至 80%(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →