AWS 证明自蒸馏推理可在 SFT 中保住推理能力
AWS ML Blog · rss · 2026-07-22
AWS 提出自蒸馏推理,缓解 SFT 里的能力遗忘
- 这篇文章讨论了一个常见问题:很多 SFT 数据没有高质量的 CoT(chain-of-thought)轨迹,直接做监督微调会很难把“会思考”的能力保留下来。
- AWS 提出 Self-Distilled Reasoning(SDR):用基础模型自己的推理轨迹作为训练时的 reasoning token,来补足缺失的思维链。
- 他们在 3 个 benchmark 上验证了方法效果,结论是:SDR 在提升目标任务表现的同时,比普通 SFT 更能减少 catastrophic forgetting,而且往往比简单 model merging 更有效。
- 文中给出的一个结果是:vanilla SFT 让数学能力平均从 70% 掉到 6%,而 SDR 基本把能力拉回来了。
- 这个方法不需要额外 teacher model,也不需要人工标注,适用于已有的 SFT 数据集。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22