单次生成胜过 64 候选采样:USC 提出 OPPD 蒸馏法

USC · hf · 2026-10-07

USC 团队提出 on-policy power distillation(OPPD):把「幂分布采样」(对完整答案概率做幂次锐化再归一化,可在不改参数下提升推理)的能力直接蒸馏进模型,让它一次生成就能产出锐化后的答案,省去多次采样打分。

具体做法是让被训练模型自己生成候选,冻结教师用幂分布权重这些候选,同一组概率再用于最大似然更新。

关键结果:

代码已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →