南加州大学提出 TOPL:将生成转为分类,提升大模型分布外泛化
robinomial · x · 2026-08-01
南加州大学的研究者提出了 Token-Level Off-Policy Labeling (TOPL) 方法,通过改变后训练范式来提升语言模型生成的忠实度。
- 核心思路:不再单纯优化预测下一个 token,而是将训练重构为 token 级别的二元分类任务,让模型学会判断生成的 token 是否“好”或“忠实”。
- 实验结果:在文档摘要任务的 11 个数据集上,TOPL 展现出强大的分布外(OOD)泛化能力,超越了多种序列级和 token 级基线方法;在机器翻译任务中也表现出良好的迁移效果。
- 机制分析:消融实验表明 token 级别的学习信号对性能至关重要,序列级方法无法提供类似收益。此外,TOPL 学习到的 LoRA 适配器起到了线性分类头和导向向量的作用,具有很好的可解释性。
「研究」频道最新
- 从零实现对比 BatchNorm/LayerNorm/GroupNorm — jcflynnnn · 2026-08-01
- Meh-Compression:基于切换线性矩阵的模型压缩法 — oatmealcraving · 2026-08-01
- OpenAI o1 核心研发离职创业,押注「自动化科学研究」 — agihouse_org · 2026-08-01
- AI 写作查重新思路:infini-gram 揭示大模型生成文本来源 — allen_ai · 2026-08-01
- AI 让《使命召唤》心跳传感器成真:无线电波感知物理世界 — bilawalsidhu · 2026-08-01
- ARC-AGI-3 榜单解析:引入动态交互与成本效率双指标 — GregKamradt · 2026-08-01