星尘智能 SmoothRL:异步执行下机器人在线 RL 只学真正执行的动作

jiqizhixin · x · 2026-09-12

机器人在执行动作 A 时,模型已在后台计算动作 B——异步推理已是真实部署的常态。但问题在于:模型一次生成一整段动作块(action chunk),其中只有一部分真正被执行,「计划的动作」和「实际做的动作」已不再一致,在线 RL 该从哪里学习?

星尘智能(Astribot)提出 SmoothRL(异步执行期间的在线强化学习):将每个动作块划分为三个区域——Committed(已提交、将执行)、Execution(本轮真正执行的帧)、Discarded(在执行前就被下一块覆盖)。只有 Execution 区域允许回传价值梯度,使策略只从机器人实际执行的动作中学习,而不是从未被执行的计划动作学习。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →