研究发现 VLA 强化学习的参数更新呈低秩,集中在被忽视的 Timestep Modules

HOLILAB · hf · 2026-10-01

HOLILAB 系统研究了强化学习如何在参数空间重塑视觉-语言-动作(VLA)策略,得出多项反直觉发现。

核心发现:

深入刻画:

应用: 沿 shift 更新方向进行引导(steering),无需额外 RL 训练即可进一步提升 RL 训练后的策略,为更高效、更可解释的 VLA 后训练提供了思路。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →