CapTrack 论文入选 NeurIPS:后训练遗忘因能力而异,指令微调漂移最强
schwarzjn_ · x · 2026-09-29
CapTrack:LLM 后训练中遗忘的多维评估,已被 NeurIPS 2026 接收(arXiv:2603.06610)。
- 重新定义「遗忘」:不只看参数/事实知识丢失,而是系统性模型漂移(model drift)导致行为与用户体验退化
- 提出以能力为中心的评估框架:行为分类学 + 能力专项指标
- 大规模实证覆盖多种后训练算法、领域与模型家族,最大至 80B 参数
- 关键发现:遗忘在能力间高度异质,鲁棒性与默认行为的漂移尤其明显;指令微调引发最强相对漂移,偏好优化更保守且可部分恢复丢失能力;不同模型家族差异持续存在,且没有通用的缓解手段
- 作者提醒:动过权重的(后训练),应检查各能力发生了什么变化
「研究」频道最新
- 伯克利 Redwood 开设「智能科学」研讨课,录像全部公开 — ceciletamura · 2026-09-29
- Boltz 联手默克办苏黎世 AI4Science 黑客松,主打蛋白质设计 — GabriCorso · 2026-09-29
- AWS 工程师手搓 2B「系统一」决策模型,登顶仅 24 小时被反超 — ShadajL · 2026-09-29
- JevBench 测试用例扩至六倍,旋转私测集严打 benchmaxxing — airesearch12 · 2026-09-29
- 在家用 4 张 V100 直播后训练 80B 模型:96 小时蒸馏 3340 条数据 — jjusko20 · 2026-09-29
- 研究称抹香鲸对话中主动交换元音,交流或更具组合性 — begusgasper · 2026-09-29