LLM 推理提效实为“过训练”?掩码蒸馏机制深度解析

rao2z · x · 2026-07-31

研究者指出,当前许多旨在减少 LLM 推理时中间 Token 长度的“效率提升”方法,本质上可能只是在特定分布上“过训练”了基础模型。

文章深入解读了 @durgeshkalwar 等人的最新论文,该研究通过掩码蒸馏(Masked Distillation)验证了这一观点:在蒸馏教师模型轨迹时,通过遮蔽部分或全部中间 Token,迫使学生模型“内化”这些生成过程。实验表明,在 GSM8K 数据集上模型能完全内化并大幅缩短推理 Token;但在 Countdown 任务中,完全内化会损害性能,部分内化则能在保持表现的同时减少 Token 长度。这为评估 LLM 推理效率提供了全新的“训练-推理权衡”视角。

所属事件:研究提出掩码蒸馏框架以降低大模型推理成本(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →