单次生成胜过 64 候选采样:USC 提出 OPPD 蒸馏法
USC · hf · 2026-10-07
USC 团队提出 on-policy power distillation(OPPD):把「幂分布采样」(对完整答案概率做幂次锐化再归一化,可在不改参数下提升推理)的能力直接蒸馏进模型,让它一次生成就能产出锐化后的答案,省去多次采样打分。
具体做法是让被训练模型自己生成候选,冻结教师用幂分布权重这些候选,同一组概率再用于最大似然更新。
关键结果:
- 相比未训练模型,MATH500 提升 23.0 分、GSM8K 提升 27.3 分(同温度单次生成)。
- 单次生成比已发表的 64 候选幂采样还高 2.4 / 3.5 分。
- 对比同预算 GRPO,MATH500/GSM8K/AIME 分别高 3.8 / 4.0 / 5.4 分,且不需要参考答案;两者互补,GRPO 之后再用 OPPD 再加最多 9.3 分。
- 只在数学上训练,HumanEval 仍提升最多 5.3 分;增益跨模型家族与规模成立。
代码已开源。
「研究」频道最新
- Scott Alexander 公开信回应 Pinker:通用智能因子真实存在,AI 能力将持续攀升 — Astral Codex Ten · 2026-10-07
- 论文:扩散 Transformer 生成早期即可读出大量图像信息 — kwangmoo_yi · 2026-10-07
- 合成细胞为何五代即衰:答案是它无法分解自身「垃圾」 — NikoMcCarty · 2026-10-07
- LLM 数值线性代数综述:从 QR 算法到支撑大模型的矩阵方法 — Abdelkader Baggag · 2026-10-07
- 哈佛发布智能体血液生物标志物发现工具:隐私不出域,AUC 中位提升 4.18 点 — Harvard · 2026-10-07
- 斯坦福研究:多用户各派一个 agent,团队效果反而不如单个 agent — rohanpaul_ai · 2026-10-07