为何研究实验室多用离线策略蒸馏来优化模型?
miifanboy · reddit · 2026-08-28
作者观察到 empero-ai 将 Qwen3.8 2.4T A95B 蒸馏到旧版 Qwen3.5 时使用了 Off-Policy Distillation(离线策略蒸馏),感到疑惑。作者认为,既然资源充足,使用 On-Policy Distillation(在线策略蒸馏)效果应该更好,因为它能让实际 KL 散度更好地匹配教师模型,真正蒸馏知识而非仅仅克隆行为。作者认为即使是使用 Qwen3.8 27B 进行 On-Policy 蒸馏也会优于当前方案。
「模型」频道最新
- 博主将重测 Grok 4.6 与 GLM 5.3 Flash 3D 游戏基准 — kevinkern · 2026-08-28
- 本地 LLM 追赶前沿尚需时日 — sdmat123 · 2026-08-28
- 仅耗时 5 小时即可本地运行前沿 AI 模型 — MaziyarPanahi · 2026-08-28
- Qwen3.8-Flash-Next 发布:媲美大厂模型的免费 AI — Two Minute Papers · 2026-08-28
- 用户质疑 DeepSeek V4 变笨:路由背锅? — l33thax0r_ · 2026-08-28
- DeepSeek V4 Flash 售价对标 GPT OSS 20B 引发成本讨论 — ChrizBogota · 2026-08-28