负向自蒸馏:让模型靠避开错误推理学会更好的推理

Rongcan Pei · hf · 2026-09-11

提出 Negative Self-Distillation 方法,通过让模型远离自身生成的有缺陷推理路径来提升推理能力,而非模仿正向样本。

核心设计是一个动态门控机制(dynamic gating),在蒸馏过程中保护模型的通用语言能力不被损伤。该方法提供了一条与正向 SFT/RLHF 互补的训练思路:从「避免错误」而非「模仿正确」中学习。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →