探讨密集蒸馏阶段的训练策略

stochasticchasm · x · 2026-08-28

讨论了在密集蒸馏阶段,如果在训练初始阶段使用 teacher forcing 而非“冻结全网络 -> 蒸馏索引器 -> 解冻”的两阶段流程,模型表现会如何。是对训练效率和技术路径的技术性探讨。

所属事件:Qwen 与 MiniMax 稀疏注意力对比及 TileLang 内核发布(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →