研究:同策略蒸馏主要抑制低概率 Token
Purdue · hf · 2026-09-01
论文《Does On-Policy Distillation Really Distill?》探讨了同策略蒸馏的机制。研究发现,该过程主要依赖于抑制低概率 Token,而非依靠教师的指导。基于这一发现,作者提出了一种无需监督的熵自适应方法,该方法显著提升了模型的推理性能。
所属事件:研究称同策略蒸馏靠抑制低概率 Token 而非教师指导(2 条相关)→
「研究」频道最新
- 开源框架 openJiuwen 刷新 SWE-bench 榜单 — omarsar0 · 2026-09-02
- ECCV 2026 将办 CDEL workshop:聚焦数据策展与高效学习 — y_m_asano · 2026-09-02
- 8年研究揭示LLM隐式符号结构 — shangbinfeng · 2026-09-02
- Mythos 5.1 偏好高风险任务与结果代理权 — Sauers_ · 2026-09-02
- Nature 研究:作者自评比同行评审更准 — weijie444 · 2026-09-02
- R3:通过强化学习训练机器人进行自然语言推理 — tw_killian · 2026-09-02