字节跳动研究:识别并过滤大模型蒸馏中的“伪信号”
ByteDance · hf · 2026-08-06
策略蒸馏(OPD)常用于将大模型的能力转移到学生模型中。然而,字节跳动的研究团队指出,模型在 token 级别的判断往往受到与输入无关的语言先验或格式习惯驱动,从而产生伪信号。这些信号虽然能产生较大的梯度,但对实际任务提升毫无帮助。
为此,团队提出了 SA-OPD(伪信号感知策略蒸馏)框架。该框架引入了一个轻量级的代理机制,用于评估 token 级别的蒸馏信号是否真正依赖于输入。它会过滤掉那些同时表现出“低输入依赖度”和“极端蒸馏差异”的 token,从而移除高影响的虚假更新。实验表明,该方法在 LLM 和视觉语言模型(VLM)上均显著优于常规 OPD 及其他选择性方法。
「研究」频道最新
- 伯克利提出 RHI 算法:优化智能体框架,推理成本大降 60% — ceciletamura · 2026-08-06
- LLM 担当自主网络防御者:多智能体协同攻防研究 — xuanalogue · 2026-08-06
- 耗时十年覆盖两千余名患者,Nature 发布人类癌症模型数据集 — anshulkundaje · 2026-08-06
- SKILL-KD:通过对比蒸馏将技能显式迁移给较弱的大模型智能体 — ZhejiangUniversity · 2026-08-06
- 普林斯顿提出 Skill Entropy,大幅提升 LLM 跨技能推理能力 — princetonu · 2026-08-06
- 腾讯研究:视觉语言智能体存在严重的空间记忆过时风险 — tencent · 2026-08-06