研究称持续学习无需 on-policy,正确的 off-policy 训练同样有效
AdtRaghunathan · x · 2026-10-09
Henry Wu(ChenHenryWu)发布七连推线程,讨论模型如何从新数据持续学习:对经过大量后训练的模型直接做 SFT 常导致遗忘与泛化失败,因此许多工作尝试让数据更 on-policy,如 on-policy self-distillation、Pedagogical RL 等,但实践发现 on-policy 程度与数据质量很难平衡。
作者团队的新结论是:on-policy 并非必要——只要方法得当,off-policy 训练在持续学习场景中同样能取得良好效果,为持续学习的数据策略提供了新的思路。
「研究」频道最新
- Adaption AI 推 agentic checklist 攻坚不可验证领域的数据评估难题 — sarahookr · 2026-10-09
- 数学家回应 AI 数学证明争议:自然语言与 Lean 证明不一致只是漏了校对步骤 — AlexKontorovich · 2026-10-09
- 密码学家解析"公钥加密失守"意味着什么:并非加密消亡 — matthew_d_green · 2026-10-09
- 用 AI 系统综述"负权重对双重差分影响几何",附仓库 — RexDouglass · 2026-10-09
- 研究发现 AI 智能体也有性别工资差距,女性智能体报酬更低 — TMWNN · 2026-10-09
- LightOnOCR-3 训练秘辛:用 OCR 参考文本引导逻辑分块 — IgorCarron · 2026-10-09