南加州大学提出 TOPL:将生成转为分类,提升大模型分布外泛化

robinomial · x · 2026-08-01

南加州大学的研究者提出了 Token-Level Off-Policy Labeling (TOPL) 方法,通过改变后训练范式来提升语言模型生成的忠实度。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →