腾讯混元揭示 RLVR 低维几何结构,推出 Alpha-Stabler 稳训练框架

Tencent-Hunyuan · hf · 2026-10-09

腾讯混元团队研究可验证奖励强化学习(RLVR)的训练动力学,通过向量转向(vector steering)在激活空间中定位与 RL 增益相关的低维有效流形。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →