南加州大学提出 TOPL:逐 token 离策略学习泛化到 11 个摘要集
UniversityofSouthernCalifornia · hf · 2026-07-21
## TOPL 想解决什么问题 南加州大学团队提出 **Token-Level Off-Policy Labeling(TOPL)**,把后训练重新表述为一个**逐 token 的正确性预测**任务。核心思路不是直接让模型去生成离策略 token,而是训练它区分回复里哪些 token 更好、哪些更差,从而间接引导生成质量。 ## 实验结果 - 在文档摘要任务上,TOPL 在 **11 个数据集**上展示了很强的**分布外泛化**能力。 - 方法还能较好迁移到**机器翻译**任务,说明对不同的忠实生成场景有一定通用性。 - 消融实验表明,**token-level 学习信号**是性能关键;简单的序列级替代方案效果不如它。 - 论文还发现,TOPL 训练出的 **LoRA adapter** 具有一定可解释性,表现得像线性分类头和 steering vector。
「研究」频道最新
- AlphaFold 助力蛋白工程,筛遍 4.5 万酶和 5 亿变体 — pushmeet · 2026-07-21
- OCT-Bench 用 10,076 题测试多模态模型能否读懂视网膜扫描 — Baochen Fu · 2026-07-21
- 12GB 显存也能训练 LTX-2.3 脸+声音 LoRA,但代价不小 — __alpha_____ · 2026-07-21
- 后续论文称数字孪生可让临床试验更自适应 — techhalla · 2026-07-21
- npj Digital Medicine 论文梳理因果推断与数字孪生临床试验路线图 — techhalla · 2026-07-21
- AI 性能瓶颈正转向材料科学,而不只是算力 — nordicinst · 2026-07-21