RL 不止微调 SFT:更长预训练带来更陡峭的 RL 扩展曲线
gleech · x · 2026-08-24
研究指出 RL 不仅仅是锐化 SFT 策略:在简单谜题上,它放大了 SFT 已偏好的正确移动;而在困难谜题上,它挖掘出了 SFT 中几乎不存在的正确移动。此外,更长的预训练带来了更陡峭的 RL 扩展斜率。
「研究」频道最新
- 训练LLM并非滚球下山:损失景观视频揭示梯度下降的奥秘 — emax · 2026-08-24
- LLM 偏好微调遇阻:跨域训练导致多样性下降 — nikaletras · 2026-08-24
- 新基准显 Agent 难以通过显式技能库积累能力 — rohanpaul_ai · 2026-08-24
- 弗朗西斯·克里克研究所启动 AI 生物发现研讨会系列 — MihaelaVDS · 2026-08-24
- 苏黎世联邦理工训练机器人打羽毛球,全身协调强化学习 — lukas_m_ziegler · 2026-08-24
- ParaTempo:利用时间置信度提升并行推理效率 — SJTU · 2026-08-24