探讨密集蒸馏阶段的训练策略
stochasticchasm · x · 2026-08-28
讨论了在密集蒸馏阶段,如果在训练初始阶段使用 teacher forcing 而非“冻结全网络 -> 蒸馏索引器 -> 解冻”的两阶段流程,模型表现会如何。是对训练效率和技术路径的技术性探讨。
所属事件:Qwen 与 MiniMax 稀疏注意力对比及 TileLang 内核发布(6 条相关)→
「研究」频道最新
- 新研究提出测试时通信,开启缩放新维度 — DimitrisPapail · 2026-08-28
- 新基准测试:AI 模型在零售模拟中表现不及贪婪算法 — ycombinator · 2026-08-28
- 前 OpenAI 员工抨击 ARC-AGI:模型表现并非 1%,系内存受限 — inductionheads · 2026-08-28
- 新方法 DiffusionOPSD 将扩散模型训练算力削减 63% — burny_tech · 2026-08-28
- EMNLP 论文揭示低资源语言 LLM 表示退化现象 — davlanade · 2026-08-28
- 谷歌推出 PaperBanana 框架,自动生成科研配图 — burkov · 2026-08-28