CMU 团队推出 SeeQ:VLM 训练通用机器人价值函数,真实任务成功率近翻倍

aviral_kumar2 · x · 2026-09-29

CMU Aviral Kumar 团队发布 SeeQ(Subtask-elicited Q-functions),在预训练 VLM(PaliGemma)之上训练通用机器人价值函数,用于引导和改进通用机器人策略。核心思路:Q 函数不再为整个长程任务估计价值,而是先以自然语言逐 token 预测当前活跃子任务,再估计其价值,从而缩短 TD 学习的信用分配视野,无需人工在部署时指定子任务。该函数在开源机器人操作数据上预训练、在下游任务上微调,用于 best-of-N 动作选择,在 4 个真实世界长程双臂操作任务上成功率接近翻倍。

所属事件:CMU 推出 SeeQ 机器人价值函数,任务成功率近翻倍(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →