Together AI 提出分数中心化,修正 RL 训练-推理失配漂移
PandaAshwinee · x · 2026-09-18
Together AI 研究员 Max Ryabinin 等发布新论文,提出针对 RL 训练-推理失配(TIM)的原理性修正方法。
- 论文指出 TIM 下 RL 不稳定的根源是漂移:训练与推理引擎间的偏差随训练步数累积
- 提出「分数中心化」(score centering)加性修正项,直接抵消漂移
- 在 0.6B 到 30B 参数模型上验证:单独使用即可比肩甚至超过基于重要性采样的方法,失配越严重优势越大
- 该修正与重要性采样可组合,组合后在 staleness 实验中优于纯重要性采样基线
所属事件:Together AI 提出分数中心化修正 RL 训练推理失配(2 条相关)→
「研究」频道最新
- Geoffrey Irving:AI 数学终极挑战是形式化 Yang-Mills 存在性与质量间隙 — geoffreyirving · 2026-09-18
- CoRL 2026 设「儿童-机器人灵巧挑战赛」,机器人与小孩同台比家务 — berkeley_ai · 2026-09-18
- 别传了:那篇「隔空传数据」论文只演示了 4cm 读温度 — basedjensen · 2026-09-18
- AI 预测器首次夺得 Metaculus 季度赛冠军 — NathanpmYoung · 2026-09-18
- 视频讲解:神经网络如何做天气预报 — ariG23498 · 2026-09-18
- 首次:LLM 完整跑在区块链上,权重与注意力全部链上计算 — AccBalanced · 2026-09-18