字节跳动研究:识别并过滤大模型蒸馏中的“伪信号”

ByteDance · hf · 2026-08-06

策略蒸馏(OPD)常用于将大模型的能力转移到学生模型中。然而,字节跳动的研究团队指出,模型在 token 级别的判断往往受到与输入无关的语言先验或格式习惯驱动,从而产生伪信号。这些信号虽然能产生较大的梯度,但对实际任务提升毫无帮助。

为此,团队提出了 SA-OPD(伪信号感知策略蒸馏)框架。该框架引入了一个轻量级的代理机制,用于评估 token 级别的蒸馏信号是否真正依赖于输入。它会过滤掉那些同时表现出“低输入依赖度”和“极端蒸馏差异”的 token,从而移除高影响的虚假更新。实验表明,该方法在 LLM 和视觉语言模型(VLM)上均显著优于常规 OPD 及其他选择性方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →