探讨模型“循环利用”与分层蒸馏的可行性

TomLucidor · reddit · 2026-09-01

Reddit 用户讨论能否超越微调和知识蒸馏,通过回收模型层级(如 MoE 模型 MarcoMini、Qwen 系列)来构建更快的模型。帖子提出“层级蒸馏”概念,探讨是否可像 NVIDIA 那样从比 Token 级别更快训练的角度复用现有层。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →