Hugging Face 探讨异步 OPD 蒸馏技术

Hugging Face 的 post-training 团队在 journal club 中探讨了异步 OPD(on-policy distillation)技术。该讨论基于一篇名为《Battling Staleness in Async...》的论文,核心关注点在于 on-policy distillation 能够实现异步化的程度。实验数据表明,这种异步蒸馏方法能够显著提升模型训练效率,在数学任务中可将训练吞吐量提升约 2 至 3 倍。

2026-07-21 ~ 2026-07-21 · 2 条相关