新研究:重复解训练出的推理能力,会在指令微调后变脆弱

burny_tech · x · 2026-09-30

论文《Fine Until Fine-Tuned: Repeated Solutions Make Reasoning Fragile》发现:在重复的推理解答样本上训练模型,会使其推理技能在后续指令微调时变得脆弱、明显退化。

对任何微调推理模型或在后续做指令/工具调用微调的团队,这篇都指出了一个低成本可规避的隐性退化问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →