VLA 上跑真实 RL 微调:十次 rollout 后策略就开始发抖

DominiqueCAPaul · x · 2026-09-28

作者分享了一次真实世界的强化学习 token 实验:只在关键环节(执行器插入)启用 RLT 相关策略,首轮 rollout 表现尚可,但约 10 次带更新的 rollout 后策略明显变得抖动(jerky)。

视频展示了这种抖动:一旦关掉 RLT 网络、让原始未微调的 VLA 接管,动作恢复平滑,执行器也能干净插入。作者推测抖动可能来自探索噪声注入或 residual policy 正则化不足,但噪声注入理应在首轮就显现,尚不确定原因。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →