腾讯混元揭示 RLVR 低维几何结构,推出 Alpha-Stabler 稳训练框架
Tencent-Hunyuan · hf · 2026-10-09
腾讯混元团队研究可验证奖励强化学习(RLVR)的训练动力学,通过向量转向(vector steering)在激活空间中定位与 RL 增益相关的低维有效流形。
- 两个几何发现:复现 RL 增益所需容量很小但不可无限压缩,极低容量下干预维度与输入表达能力成为约束;有效控制方向主要位于激活主子空间的低方差补空间
- 同一任务与基模型下几何结构跨训练配置保持一致,跨任务的几何对齐度与能力迁移相关;实验覆盖 5 个 LLM 与 6 个可验证奖励任务
- 提出 Alpha-Stabler 即插即用框架:Predictor 监控主子空间入侵以提前预警崩溃,Controller 在反向传播中去除激活梯度的主子空间分量
- Alpha-Stabler 可稳定训练 2000 步并持续提升 RL 增益,代码已开源
「研究」频道最新
- U-Space:用机制可解释性找到 LLM 内部「不确定子空间」,无需训练可测信心 — Tobias Braun · 2026-10-09
- CARE:带统计保证的 VLA 推理加速认证,OpenVLA-OFT 提速 9-10.8 倍 — UMCP · 2026-10-09
- 评测文本扩散模型太难?新方法 SOL 用样本分布距离破局 — NandoDF · 2026-10-09
- MaRN 库用低维参数映射压缩网络:MNIST CNN 参数减 57.7 倍 — Less_Dream_6331 · 2026-10-09
- AI 进塔木德研讨会:专家意见分歧时如何评测 AI 成了难题 — EhudReiter · 2026-10-09
- TRL v1.15 融合 LM head,峰值显存省 82%、序列长 7 倍 — QGallouedec · 2026-10-09