VLA 上跑真实 RL 微调:十次 rollout 后策略就开始发抖
DominiqueCAPaul · x · 2026-09-28
作者分享了一次真实世界的强化学习 token 实验:只在关键环节(执行器插入)启用 RLT 相关策略,首轮 rollout 表现尚可,但约 10 次带更新的 rollout 后策略明显变得抖动(jerky)。
视频展示了这种抖动:一旦关掉 RLT 网络、让原始未微调的 VLA 接管,动作恢复平滑,执行器也能干净插入。作者推测抖动可能来自探索噪声注入或 residual policy 正则化不足,但噪声注入理应在首轮就显现,尚不确定原因。
「具身」频道最新
- 21 岁创始人 Airbound:载重比 1.67x 的无人机要取代汽车公交 — Not Boring (Packy McCormick) · 2026-09-28
- HSImul3R 入选 ECCV 2026:让「看着对」的人体重建真正能进物理仿真 — jiqizhixin · 2026-09-28
- 全球最大规模人形机器人直播表演,现场观众超一万人 — kernelangus420 · 2026-09-28
- VR 单臂接管训练:AI 控制另一臂体验怪异 — neurosp1ke · 2026-09-28
- 中科大 VLA-Precision:真实世界在线 RL,四类高精度化学任务 98.3% 成功率 — ustc · 2026-09-28
- 机器人训练卡壳?作者把噪声注入从 2.5% 降到 0.25% 后明显改善 — DominiqueCAPaul · 2026-09-28