南加州大学提出 TOPL:逐 token 离策略学习泛化到 11 个摘要集

UniversityofSouthernCalifornia · hf · 2026-07-21

## TOPL 想解决什么问题 南加州大学团队提出 **Token-Level Off-Policy Labeling(TOPL)**,把后训练重新表述为一个**逐 token 的正确性预测**任务。核心思路不是直接让模型去生成离策略 token,而是训练它区分回复里哪些 token 更好、哪些更差,从而间接引导生成质量。 ## 实验结果 - 在文档摘要任务上,TOPL 在 **11 个数据集**上展示了很强的**分布外泛化**能力。 - 方法还能较好迁移到**机器翻译**任务,说明对不同的忠实生成场景有一定通用性。 - 消融实验表明,**token-level 学习信号**是性能关键;简单的序列级替代方案效果不如它。 - 论文还发现,TOPL 训练出的 **LoRA adapter** 具有一定可解释性,表现得像线性分类头和 steering vector。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →