Princeton 团队提出覆盖原理与 TailSFT:换掉交叉熵 SFT,让 RL 后性能更强

canondetortugas · x · 2026-09-12

来自 Princeton/Fan Chen、Sadhika Malladi、Dylan Foster 等人的 arXiv 论文《The Coverage Principle: How Pre-Training Enables Post-Training》,从理论视角解释预训练如何决定后训练成败。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →