从第一性原理拆解 RL 不稳定根源,Score Centering 直接抵消
_AndrewZhao · x · 2026-09-19
RL with LLMs 在训练策略与采样策略数值不一致(training/sampling mismatch)时非常不稳定,标准修法如数值对齐、重要性采样只是绕过问题。这条线程称从第一性原理找到了不稳定性的根因,并提出直接将其抵消的方法——Score Centering:实现简单,性能有竞争力,且可与现有方法叠加使用。
所属事件:Together AI 提出分数中心化,修正 RL 训练-推理失配(3 条相关)→
「研究」频道最新
- 把 reranker 改成决策引擎,Jev 式 API 电车难题永远拉杆 — gaganghotra_ · 2026-09-19
- 连续扩散语言模型新技巧:仅增 1-3% 推理算力即可引导生成 — itsbautistam · 2026-09-19
- 用 LLM 算历代名将 WAR:拿破仑稳居历史第一 — ctjlewis · 2026-09-19
- MIT 新论文追踪 10.8 万个开源模型的生命周期兴衰 — asusarla · 2026-09-19
- Meta Muse + Jev 十秒级筛出免疫学百大未解问题 — DeryaTR_ · 2026-09-19
- 26人团队提出ABC清单:Agent基准设计缺陷可致成绩误估高达100% — ddkang · 2026-09-19