研究揭示 RL 训练不稳定根源:Score Centering 实为 STE 技巧
brandondamos · x · 2026-09-21
@mryabinin 提出从第一性原理分析 LLM 强化学习中训练策略与采样策略不一致导致的训练不稳定问题,指出常规修复(数值对齐、重要性采样)只是绕过而非根治,并提出 Score Centering 直接抵消该不稳定性,实现简单且兼容现有方法。
@YouJiacheng 补充观察:Score Centering 本质上「偷偷」就是一个 STE(直通估计器),形式为 zp + sg(zq - zp)。
所属事件:研究称RL训练中Score Centering实为直通估计器技巧(2 条相关)→
「研究」频道最新
- Jev 被指与 8 个月前论文 autorubric 评测抽象几乎一一对应 — deliprao · 2026-09-21
- 研究者称 TypeSafe 的 Jev 抽象与其 8 个月前 Autorubric 论文高度相似 — deliprao · 2026-09-21
- ICLR 2027 投稿超 6 万篇,研究者提议限每人 3-4 篇 — ziv_ravid · 2026-09-21
- ICLR 2027 投稿破 6 万篇,研究者吁全面改革会议制度 — ziv_ravid · 2026-09-21
- Laya 并非仅支持 512 上下文:实为 ModernBERT,配置上限 8192 — antoine_chaffin · 2026-09-21
- 开源决策模型 Kev 发布 0.6B/4B/8B,单张 H100 训练 40 分钟 — TheMoonMidas · 2026-09-21