LLM 持续学习方法 iSDFT 开源:500+ 实验平衡可塑性与稳定性
hbouammar · x · 2026-09-23
研究者发布 Info-SDFT(iSDFT):一种面向信息约简的在策略自蒸馏方法,用于 LLM 的有效持续学习。核心思路:
- 学生模型先生成回答,再由以示例为条件的教师提供 token 级引导
- 不直接匹配完整教师分布,而是构造「在满足教师信息约束下、与当前学生最近的分布」,兼顾可塑性与稳定性
- 另设对冻结初始模型的 KL 锚点,限制训练中的漂移
团队做了超过 500 组实验验证,已开源训练代码、Tool Use 与 Science 数据集、评测器及训练好的 checkpoints。
「研究」频道最新
- 双模型分工:MatBrain 用 48 小时筛选 3 万个晶体候选材料 — bravo_abad · 2026-09-23
- Scale AI 发布 SWE-Bench Pro V2 基准 — bigblueboo · 2026-09-23
- 新论文:把 VLM 的智能迁移到机器人控制 — _akhaliq · 2026-09-23
- 南洋理工 UMM 研究:原生多模态中理解与生成互相增益但共享有冲突 — jiqizhixin · 2026-09-23
- CoRL 2026 工作会聚焦:控制器与硬件比算法更影响机器人表现 — pulkitology · 2026-09-23
- Xeno-Interpretability 论文追问:可解释性之外还有什么? — burny_tech · 2026-09-23