Princeton 团队提出覆盖原理与 TailSFT:换掉交叉熵 SFT,让 RL 后性能更强
canondetortugas · x · 2026-09-12
来自 Princeton/Fan Chen、Sadhika Malladi、Dylan Foster 等人的 arXiv 论文《The Coverage Principle: How Pre-Training Enables Post-Training》,从理论视角解释预训练如何决定后训练成败。
- 核心概念:coverage(覆盖率)——预训练模型放在高质量回答上的概率质量,它是 Best-of-N 等 post-training 与测试时扩展方法成功的充要条件;coverage 比交叉熵损失更能预测下游表现,因为它避免了对序列长度等问题参数的虚假依赖。
- 机制:next-token 预测(极大似然)会隐式优化出良好覆盖,这解释了预训练为何有效。
- 实践干预:checkpoint/模型选择、梯度归一化、测试时解码等可证明地提升覆盖。
- 后续工作 TailSFT(Malladi 团队):RL 训练昂贵,每一步都要有效;传统交叉熵 SFT 并非 RL 的最佳准备方式,TailSFT 是一种轻量、有原则的方法,直接提升覆盖从而改善 RL 后性能。
「研究」频道最新
- 菲尔兹奖得主联署声明:AI 解题热潮与数学界严重错位 — hbouammar · 2026-09-12
- 17B 模型从 SSD 跑起:单核 33 tokens/s,无 GPU 训练 — Just_Vugg_PolyMCP · 2026-09-12
- Fortnow:可写持久记忆或让 ML 系统自我改写、递归自我改进 — fortnow · 2026-09-12
- 研究者训练果蝇大脑操作 ChatGPT,16 词输出 100% 泛化 — neuroecology · 2026-09-12
- 可推理视觉语言模型迭代检索,提升多语言实体链接 — neulab · 2026-09-12
- SkySynth 发布:代码与形式化证明共同进化,KV 存储快 Redis 2.3 倍 — CShorten30 · 2026-09-12