研究:同策略蒸馏主要抑制低概率 Token

Purdue · hf · 2026-09-01

论文《Does On-Policy Distillation Really Distill?》探讨了同策略蒸馏的机制。研究发现,该过程主要依赖于抑制低概率 Token,而非依靠教师的指导。基于这一发现,作者提出了一种无需监督的熵自适应方法,该方法显著提升了模型的推理性能。

所属事件:研究称同策略蒸馏靠抑制低概率 Token 而非教师指导(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →