Meta 提出「锐化税」:RL 后训练以损失 pass@K 覆盖换单次准确率

meta · hf · 2026-10-02

Meta 的研究实证了 LLM 后训练中的「锐化假说」并给出修正:在智能体任务上,预训练模型配上轻量推理 harness 后,虽然 pass@1 远低于 RL 后训练版本,但在足够测试预算下 pass@K 解题覆盖反而常常超过后训练版本。机制分析显示,后训练把任务推向「必解」或「永不解」两个极端,用解题覆盖换取采样效率与一致性。作者提出诊断指标 Sharpening Tax 量化后训练对测试时扩展性的损失,在 4 个模型家族 14 对 base/后训练模型、3 个智能体基准(42 组)上验证其普遍存在、可由少量 rollout 估计。他们还提出即插即用的贝叶斯采样器 PTGS(后验温度化组采样),按每题估计难度自适应调温,在两个智能体环境中 RL 训练时税更小,重复采样解出更多任务且单次准确率也提升。

所属事件:研究提出「锐化税」:后训练磨利旧技能而非教新能力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →