微调后为何会记住但不会用
HKUST · hf · 2026-07-13
这篇论文研究大模型微调中的一个常见问题:模型能快速记住新知识,但在下游推理任务里却用不出来。 作者把这一现象形式化为 **Knowing–Using Gap**,包括两个特征: - 记忆与泛化之间的准确率差距 - 知识从记住到真正可用之间的时间滞后 为了解释其内部机制,论文提出 **self-patching** 干预方法,追踪知识在模型内部的空间扩散动态,并定位那些把表征迁移到正确层后能显著改善失败案例的位置。结果支持一种“知识电路错配”的假设:知识虽然已在内部存在,但没有被路由到能参与计算的层。最后作者给出一个简单启发式策略,在泛化失败案例中恢复了约 58%–75% 的 oracle 余量。
所属事件:研究揭示大模型微调后的“知行差距”困境(2 条相关)→
「研究」频道最新
- Tri-Net v2 开源猴痘检测框架,配套 Scientific Reports 论文 — Rich-Fruit-326 · 2026-07-21
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- UIUC 提出 AgentPrimitives:多智能体的可复用潜在积木 — 机器之心 · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21
- 微软提出像训练神经网络一样训练 agent 技能 — Saboo_Shubham_ · 2026-07-21
- 研究者:AI 应是放大器,而不是放弃科研的理由 — omarsar0 · 2026-07-21