EMNLP 口头报告:RL 教模型更高效遍历参数化知识
niloofar_mire · x · 2026-09-30
一篇入选 EMNLP oral 的论文发现:强化学习能让模型更有效地遍历其参数化知识,从而访问到在 instruction-tuned 模型中原本无法触达的知识。也就是说,RL 训练不只是对齐行为,还能解锁基座中已有但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan,原推附有详细线程。
「研究」频道最新
- UMass 教授 Luc Rey-Bellet 三套随机过程讲义公开,覆盖 MCMC 基础 — michaelchchoi · 2026-09-30
- VoxMem 基准:15 个音频大模型记忆能力无一超过 40% — unimelb-hf · 2026-09-30
- EpiCon:多智能体共享多模态记忆库,11 项基准平均提升 1.7-4.9 分 — Ziyun Zeng · 2026-09-30
- EngiWorld 基准:最强模型工程软件得分仅 44.3,跨软件任务成功率 3.6% — zhiman-ai · 2026-09-30
- 研究:伪造聊天模板的注入威力藏在保留 token 向量里,39-66 个百分点 — PekingUniversity · 2026-09-30
- 量化 softmax 预训练 Transformer:K=16 时验证损失仅增 0.004 nats — illinois · 2026-09-30