研究发现 VLA 强化学习的参数更新呈低秩,集中在被忽视的 Timestep Modules
HOLILAB · hf · 2026-10-01
HOLILAB 系统研究了强化学习如何在参数空间重塑视觉-语言-动作(VLA)策略,得出多项反直觉发现。
核心发现:
- 在 π₀.₅、GR00T N1.5/N1.6 等主流流匹配 VLA 模型上(LIBERO、ManiSkill、MetaWorld、CALVIN 基准),RL 引入的参数更新秩显著更低,且高度集中在动作专家中此前被忽视的小组件——Timestep Modules
- 模块替换实验表明,这些模块承载了 RL 性能增益的绝大部分
- RL 使这些模块特化于 rollout 用的离散去噪时间步,正是离散时间步训练导致了低秩更新
深入刻画:
- 各输出中 shift 向量在 RL 下变化最显著,其更新方向可强预测任务成功(ROC-AUC 高达 99.6%)
- shift 更新的几何结构反映任务关系:成对相似度与跨任务迁移模式相关
应用: 沿 shift 更新方向进行引导(steering),无需额外 RL 训练即可进一步提升 RL 训练后的策略,为更高效、更可解释的 VLA 后训练提供了思路。
「具身」频道最新
- personalized bugs:不同用户的 Dots 各有各的缺陷 — ChrisGPT · 2026-10-01
- 40 克无人机靠声纹锁定蚊子,空中精准拦截改写灭蚊逻辑 — TinfoilTricorn · 2026-10-01
- Google DeepMind 东京招聘游戏 AI 高级研究工程师,主攻 SIMA 与通用游戏 Agent — heiga_zen · 2026-10-01
- 值得关注的机器人圈 5 大风向标账号:Jim Fan、Physical Intelligence 双创在列 — RemiCadene · 2026-10-01
- DyRAD 实现动态驾驶场景雷达新视角合成,检出率 90.7% 远超基线 26.9% — Technion · 2026-10-01
- NVIDIA Cosmos 负责人刘明宇谈开源模型与物理 AI 未来 — Practical AI · 2026-10-01