星尘智能 SmoothRL:异步执行下机器人在线 RL 只学真正执行的动作
jiqizhixin · x · 2026-09-12
机器人在执行动作 A 时,模型已在后台计算动作 B——异步推理已是真实部署的常态。但问题在于:模型一次生成一整段动作块(action chunk),其中只有一部分真正被执行,「计划的动作」和「实际做的动作」已不再一致,在线 RL 该从哪里学习?
星尘智能(Astribot)提出 SmoothRL(异步执行期间的在线强化学习):将每个动作块划分为三个区域——Committed(已提交、将执行)、Execution(本轮真正执行的帧)、Discarded(在执行前就被下一块覆盖)。只有 Execution 区域允许回传价值梯度,使策略只从机器人实际执行的动作中学习,而不是从未被执行的计划动作学习。
「具身」频道最新
- 具身智能距「ChatGPT 时刻」还有多远 — globalsouthworld · 2026-09-12
- ETH Zürich 机器人上演云中漫步:跳上云梯悬荡翻越后稳稳落地 — lukas_m_ziegler · 2026-09-12
- Walden Robotics:自主性不是 0/1,而是可优化的「远程协助比例」 — xmercury_one · 2026-09-12
- 记者花 4000 美元买中国产机器狗,遛狗路上回头率爆表 — Ars Technica AI · 2026-09-12
- 人形机器人首次「感知」人类触摸,触觉学习演示曝光 — TansuYegen · 2026-09-12
- 生数发布Motus2世界模型:五项真机灵巧任务平均成功率84% — 生数科技 · 2026-09-12