Sharpening Tax in Post-Training
Changdae Oh, Qi Zeng, Qi Qi, Andrey Zhmoginov, Deren Lei, Yun He, Hoang Phan, Hangoo Kang, Azalia Mirhoseini, Sharon Li
cs.AI, cs.LG
2026-10-01
14 对开源模型 agent 评测:后训练升 pass@1 降 pass@K,采样预算够时 base 模型反超;覆盖损失被量化为 Sharpening Tax,PTGS 可降税。
RL 后训练到底给模型加了新能力,还是只把 base 模型已有的行为磨得更稳?此前证据几乎全部来自数学和代码题:后训练模型 pass@1 更高,base 模型在大预算 pass@K 下反超。但这两个领域最没资格下结论:预训练语料塞满了数学和代码,评测又常只比对最终答案,推理错误但答案蒙对的轨迹照样得分,pass@K 被系统性高估。
Agent 任务才是压力测试场:多轮工具调用、环境反馈、长轨迹在预训练数据里少见,普遍被当作后训练才学会的技能。Meta Superintelligence Labs 联合 UW-Madison、NYU、Stanford 的团队在 14 对开源 checkpoint、3 个 agent benchmark 上把问题测了一遍,结论:后训练改变的主要是解题可靠度,不是能解哪些题。
三层递进:先测现象,再定机制,最后给指标和补救。
为什么按难度调温?全局升温救 pass@K 毁 pass@1,两头不可兼得;GRPO 这类组对比算法又只在组内既有成功又有失败时才有非零 advantage,给难题加热恰好提高混合组出现频率。PTGS 不动 RL 更新规则,即插即用。
| 对照 | 指标 | 结果 |
| WebShop,gemma-4-31B,K=128 | pass@128 | base+harness 超过 85%,post-trained 56% |
| 同上,按 128 条成败分档 | 给算力能解的占比 | 87.6% 降到 30.0%,never solved 从 12.4% 涨到 44.0% |
| 8 个 base 模型均值,BFCL | 加 harness 后 pass@32 | 15.19 升到 49.13 |
| 42 组模型×benchmark | TaxS(128) 为正 | 36/42 |
| 8 条 rollout 估 32 条的税 | Spearman ρ | 0.85 |
交叉点随规模前移:WebShop 上 4B 模型要超过 128 条才反超,31B 约 3 条就够。最小的 3B 档在小预算下税为负,算力紧缺时锐化是净收益。
PTGS 用 Qwen2.5-7B-Instruct 在 Sokoban 和 FrozenLake 上验证,200 步、5 个种子,PPO 与 GRPO 各一组:
| 方法(Sokoban) | pass@1 | pass@128 |
| base | 20.7 | 76.6 |
| PPO | 46.5 | 55.0 |
| PPO+PTGS | 61.1 | 69.7 |
四个算法×环境组合里,PTGS 全部同时抬高 pass@1 与 pass@128,税值也更低。训练日志给出直接解释:固定温度 PPO 的输出熵单调下滑,PTGS 的熵保持高位并反复回升,难题一直留有探索空间。
做 agent 搜索类应用的人该记一条:有可扩展验证器时,base 模型加 harness 加重复采样,覆盖上限可能高于 instruct 版;科学发现、自动化研究这类蒙对一次就赢的场景尤其值得试。单次调用要稳定,继续用 post-trained 模型。
论文还主张把 Sharpening Tax 与 pass@1 一起报,8 条 rollout 就能估,成本很低;PTGS 只动采样器,组采样 RL 流程都能挂上。比例也要说清:诊断覆盖 42 组对照,补救只在一个 7B 模型、两个玩具环境验证过,两头规模差一截。
论文自认四条:开源 checkpoint 训练数据不公开,只能观察、无法归因;没比较 RL、SFT、蒸馏各收多少税;只测文本 agent,多模态与 VLA 存疑;税依赖二值成功信号,开放式生成要换成质量门控的多样性度量。
再补三点。「RL post-trained」是宽泛标签,instruct checkpoint 可能以 SFT 为主,不影响指标定义,但削弱针对 RL 的断言力度。PTGS 实验里 GRPO 取验证最优 checkpoint、PPO 取末尾,标准不统一;Sokoban、FrozenLake 与 BFCL、WebShop 复杂度差着量级,PTGS 在真实 agent 环境是否有效没有证据。harness 对 base 有利、对 post-trained 有害(论文 Table 4),交叉点位置因此部分取决于脚手架选择。