slime 合入 Score Centering:从第一性原理解决 RL 训练与采样策略不一致的不稳定
hsu_byron · x · 2026-09-23
开源 RL 训练框架 slime(THUDM,8.5k star)合入了 Score Centering 支持,通过 --use-score-centering 开启。
- 问题背景:当 LLM 的 RL 训练策略与采样策略不一致时,训练非常不稳定;常见修补(匹配数值精度、重要性采样)都是绕开问题
- Ryabinin 等人从第一性原理找到这种不稳定性的根因,并提出直接抵消它的方法;Score Centering 性能具竞争力,且与现有方案兼容、实现极简
- 配套 PR 已合入 slime 主干,今天即可在训练中启用
「编程与Agent」频道最新
- 开源运行时 Kiso:工具执行崩溃后「无回执」状态如何恢复 — niurenwangdadan · 2026-09-23
- 开源 GUI 智能体跨设备实测:复合任务最佳成功率仅 8% — maier_ak · 2026-09-23
- JarvisGUI 基准:跨 Android/Windows/Ubuntu 考验 GUI 智能体 — maier_ak · 2026-09-23
- 新基准 Cross-DURIAN:专测多设备 GUI 智能体跨屏协作能力 — maier_ak · 2026-09-23
- 个人 Agent 的「主动」要分层看:提醒、提案还是替你干完? — sujingshen · 2026-09-23
- 开源工具 Enola 用代码库结构图谱约束 AI 编码智能体 — yellow-llama1 · 2026-09-23