EMNLP 口头报告:RL 教模型更高效遍历参数化知识

niloofar_mire · x · 2026-09-30

一篇入选 EMNLP oral 的论文发现:强化学习能让模型更有效地遍历其参数化知识,从而访问到在 instruction-tuned 模型中原本无法触达的知识。也就是说,RL 训练不只是对齐行为,还能解锁基座中已有但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan,原推附有详细线程。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →