蒸馏学的是犹豫不是答案:小模型变强的手艺与多轮崩盘的坑

大模型之路 · wechat · 2026-08-27

本文系统讲解知识蒸馏:学生学的不是硬标签而是老师的概率分布("85%是猫、10%是猞猁"),那 10% 编码的类间相似性就是 Hinton 所说的暗知识,需用温度参数(典型 2-20)放大尾部小概率。

与量化、剪枝正交可叠加:量化降精度、剪枝删冗余是改同一个模型,蒸馏是训练全新模型,正确顺序是先蒸馏再量化(如 DistilBERT 体积小 40%、快 60%,保留 BERT 约 97% 的 GLUE 成绩)。

蒸馏模型为何长任务崩盘:主流离线蒸馏有曝光偏差——学生只见过老师的漂亮输出,推理时接着自己的输出走,一步偏则步步错,累积误差随序列长度呈 O(T²) 增长。在线蒸馏让学生先自己生成、老师逐 token 给分布,误差降到 O(T),且每个 token 都有反馈,比 RL 更省。综述 arXiv:2604.00626 用 f-散度框架按反馈信号、老师可见度、损失粒度三维度归类了这类方法。

两条硬约束:老师是学生的天花板;蒸馏迁移的是特定领域应答行为而非整个知识体系,老师的错误会被继承放大。DeepSeek-R1 报告指出小模型直接跑大规模 RL 可能不如蒸馏,划出分工:RL 用于前沿模型长出新能力,蒸馏用于低成本复制已有能力。

落地路径:用线上真实请求跑老师模型存成蒸馏语料 → 选开源底座微调 → 用业务评测集盯多轮和长回答退化,跑通后再升级在线蒸馏。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →