Replay on Demand:按遗忘动态在线分配回放数据的新持续预训练方法
schwarzjn_ · x · 2026-10-02
Jonathan Richard Schwarz 团队发布 arXiv 论文《Replay on Demand (RoD)》,解决持续预训练中「适应新领域 vs 遗忘旧能力」的取舍问题。
- 核心思路:固定回放混合比例不关心模型实际需要保留什么。RoD 改为从模型学习动态出发,同时按「剩余学习潜力」排适应样本、按「观测到的遗忘程度」排回放样本,两者竞争同一训练预算,自发形成在线课程(curriculum)。
- 效果:跨模型、规模和适应领域,RoD 达到或超过调优过的固定回放基线与模型合并方法的「适应-遗忘」前沿,且无需预先指定回放比例。
- 机制发现:回放自动集中在更易被遗忘的数据源上,并随训练中遗忘的出现动态增加和重新分配。
- 作者称这是 RHO 选样方法的简单直觉扩展,学到的课程可跨规模迁移,摊薄成本。
所属事件:图宾根团队提出 RoD:按需回放缓解持续预训练遗忘(2 条相关)→
「研究」频道最新
- YC Paper Club 探讨 GPU 之外的 AI 算力:光学、神经形态与生物计算 — ycombinator · 2026-10-02
- Apple 提出 LoopCD:免费为循环 Transformer 提速减算 22-48% — apple · 2026-10-02
- CMU 机器学习博客发布 Forking-Sequences 第二部:多时程预测集成 — rsalakhu · 2026-10-02
- AI 并没有解出纳维-斯托克斯方程,那它到底做了什么? — elsleightholm · 2026-10-02
- Gary Marcus 约战 LLM 痛感论文作者,索要对照实验权限 — GaryMarcus · 2026-10-02
- Sasha Rush 将出席 COLM 2025,公开邀约聊测试时训练与有偏 RL — srush_nlp · 2026-10-02