RL 后训练交「锐化税」:base 模型加轻 harness,agent 覆盖率反超

Sharpening Tax in Post-Training

Changdae Oh, Qi Zeng, Qi Qi, Andrey Zhmoginov, Deren Lei, Yun He, Hoang Phan, Hangoo Kang, Azalia Mirhoseini, Sharon Li

cs.AI, cs.LG

2026-10-01

14 对开源模型 agent 评测:后训练升 pass@1 降 pass@K,采样预算够时 base 模型反超;覆盖损失被量化为 Sharpening Tax,PTGS 可降税。

这篇在解决什么

RL 后训练到底给模型加了新能力,还是只把 base 模型已有的行为磨得更稳?此前证据几乎全部来自数学和代码题:后训练模型 pass@1 更高,base 模型在大预算 pass@K 下反超。但这两个领域最没资格下结论:预训练语料塞满了数学和代码,评测又常只比对最终答案,推理错误但答案蒙对的轨迹照样得分,pass@K 被系统性高估。

Agent 任务才是压力测试场:多轮工具调用、环境反馈、长轨迹在预训练数据里少见,普遍被当作后训练才学会的技能。Meta Superintelligence Labs 联合 UW-Madison、NYU、Stanford 的团队在 14 对开源 checkpoint、3 个 agent benchmark 上把问题测了一遍,结论:后训练改变的主要是解题可靠度,不是能解哪些题。

方法

三层递进:先测现象,再定机制,最后给指标和补救。

为什么按难度调温?全局升温救 pass@K 毁 pass@1,两头不可兼得;GRPO 这类组对比算法又只在组内既有成功又有失败时才有非零 advantage,给难题加热恰好提高混合组出现频率。PTGS 不动 RL 更新规则,即插即用。

结果

对照指标结果
WebShop,gemma-4-31B,K=128pass@128base+harness 超过 85%,post-trained 56%
同上,按 128 条成败分档给算力能解的占比87.6% 降到 30.0%,never solved 从 12.4% 涨到 44.0%
8 个 base 模型均值,BFCL加 harness 后 pass@3215.19 升到 49.13
42 组模型×benchmarkTaxS(128) 为正36/42
8 条 rollout 估 32 条的税Spearman ρ0.85

交叉点随规模前移:WebShop 上 4B 模型要超过 128 条才反超,31B 约 3 条就够。最小的 3B 档在小预算下税为负,算力紧缺时锐化是净收益。

PTGS 用 Qwen2.5-7B-Instruct 在 Sokoban 和 FrozenLake 上验证,200 步、5 个种子,PPO 与 GRPO 各一组:

方法(Sokoban)pass@1pass@128
base20.776.6
PPO46.555.0
PPO+PTGS61.169.7

四个算法×环境组合里,PTGS 全部同时抬高 pass@1 与 pass@128,税值也更低。训练日志给出直接解释:固定温度 PPO 的输出熵单调下滑,PTGS 的熵保持高位并反复回升,难题一直留有探索空间。

为什么重要

做 agent 搜索类应用的人该记一条:有可扩展验证器时,base 模型加 harness 加重复采样,覆盖上限可能高于 instruct 版;科学发现、自动化研究这类蒙对一次就赢的场景尤其值得试。单次调用要稳定,继续用 post-trained 模型。

论文还主张把 Sharpening Tax 与 pass@1 一起报,8 条 rollout 就能估,成本很低;PTGS 只动采样器,组采样 RL 流程都能挂上。比例也要说清:诊断覆盖 42 组对照,补救只在一个 7B 模型、两个玩具环境验证过,两头规模差一截。

局限与存疑

论文自认四条:开源 checkpoint 训练数据不公开,只能观察、无法归因;没比较 RL、SFT、蒸馏各收多少税;只测文本 agent,多模态与 VLA 存疑;税依赖二值成功信号,开放式生成要换成质量门控的多样性度量。

再补三点。「RL post-trained」是宽泛标签,instruct checkpoint 可能以 SFT 为主,不影响指标定义,但削弱针对 RL 的断言力度。PTGS 实验里 GRPO 取验证最优 checkpoint、PPO 取末尾,标准不统一;Sokoban、FrozenLake 与 BFCL、WebShop 复杂度差着量级,PTGS 在真实 agent 环境是否有效没有证据。harness 对 base 有利、对 post-trained 有害(论文 Table 4),交叉点位置因此部分取决于脚手架选择。

术语

原文与代码

相关论文

全部论文解读