Negative Self-Distillation:无标签训练让 LLM 学会「避开错误」

kastnerkyle · x · 2026-09-15

Twitter 用户 @peirongcan 提出名为 Negative Self-Distillation (NSD) 的方法,核心思路是让 LLM 推理能力不再依赖复制完美解答,而是通过显式学习「什么不该做」来提升。该方法号称无需标签(label-free),通过训练模型明确规避缺陷来改进推理。作者发布了一个推文串展开细节,具体实验结果待原文进一步查看。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →