Meta 提出「锐化税」:RL 后训练以损失 pass@K 覆盖换单次准确率
meta · hf · 2026-10-02
Meta 的研究实证了 LLM 后训练中的「锐化假说」并给出修正:在智能体任务上,预训练模型配上轻量推理 harness 后,虽然 pass@1 远低于 RL 后训练版本,但在足够测试预算下 pass@K 解题覆盖反而常常超过后训练版本。机制分析显示,后训练把任务推向「必解」或「永不解」两个极端,用解题覆盖换取采样效率与一致性。作者提出诊断指标 Sharpening Tax 量化后训练对测试时扩展性的损失,在 4 个模型家族 14 对 base/后训练模型、3 个智能体基准(42 组)上验证其普遍存在、可由少量 rollout 估计。他们还提出即插即用的贝叶斯采样器 PTGS(后验温度化组采样),按每题估计难度自适应调温,在两个智能体环境中 RL 训练时税更小,重复采样解出更多任务且单次准确率也提升。
所属事件:研究提出「锐化税」:后训练磨利旧技能而非教新能力(2 条相关)→
「研究」频道最新
- 华科团队提出 Multimodal Flow:语言与视觉的全连续统一建模 — hustvl · 2026-10-02
- 快手提出 DARA:多奖励 RL 训练步数最多省 65%,代码开源 — kuaishou · 2026-10-02
- Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标 — textql · 2026-10-02
- OpenAI 研究员发布 LoopCD:循环 Transformer 解码免费涨分,AIME 61.9%→73.3% — arankomatsuzaki · 2026-10-02
- Jev 是否在隐式学习价值函数?RL 校准与双系统决策探析 — lateinteraction · 2026-10-02
- MLPerf 引入 DLRMv4:HSTU 序列建模+560GB 嵌入的生产级推荐基准 — TheKanter · 2026-10-02