掩码蒸馏框架:将思维链内化以降低大模型推理成本

rao2z · x · 2026-07-31

大型推理模型(LRM)在生成最终答案前会产生冗长的中间推理步骤,这极大增加了推理延迟、内存消耗和服务成本。亚利桑那州立大学等机构的研究者提出了掩码蒸馏框架,试图将这些中间计算过程“内化”到模型参数中。

该框架包含两种模式:一种是自蒸馏(同一模型在思考模式下作为教师,在非思考模式下作为学生);另一种是双模型蒸馏(较大的推理模型指导较小的非思考模型)。研究表明,这种方法提供了一种训练与推理的权衡视角:通过在特定分布的问题上过度训练基础模型,可以减少推理时产生的中间Token,从而提升效率。

所属事件:研究提出掩码蒸馏框架以降低大模型推理成本(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →