新研究:重复解训练出的推理能力,会在指令微调后变脆弱
burny_tech · x · 2026-09-30
论文《Fine Until Fine-Tuned: Repeated Solutions Make Reasoning Fragile》发现:在重复的推理解答样本上训练模型,会使其推理技能在后续指令微调时变得脆弱、明显退化。
- 风险场景:小数据、多 epoch 的推理蒸馏(常见于多阶段 post-training 流水线)最易踩坑。
- 修复手段:改用新鲜的解答样本训练,或在格式数据上做短暂再训练,即可修复性能下降。
对任何微调推理模型或在后续做指令/工具调用微调的团队,这篇都指出了一个低成本可规避的隐性退化问题。
「研究」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- EMNLP 口头报告:RL 教模型更高效遍历参数化知识 — niloofar_mire · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- 研究者预言神经网络或可分解为演化式符号系统 — QuintinPope5 · 2026-09-30