Meta 研究:RL 后训练反而降低大模型多轮任务测试时扩展性
dair_ai · x · 2026-10-04
Meta Superintelligence Labs 的新论文发现一个反直觉现象:在 BFCL v4 多轮、ACEBench、WebShop 等 agentic 任务上,带轻量 harness 的基座模型在大采样数下往往比 RL 后训练版本解决更多任务。
要点:
- 后训练模型赢在 pass@1,但大 K 采样下基座模型常能解决后训练模型从未解决过的任务。
- 原因是后训练把每道题推向「总能解出」或「总解不出」:一致性上升,覆盖面下降,作者称之为「Sharpening Tax」。
- 在 42 对 base/post-trained 模型上,该现象在多数设定出现,且随模型规模增大,可用少量 rollout 估算。
- 修复方案 PTGS:在 RL 时根据每个 prompt 的预估难度设置采样温度,税更低且 pass@1 也提升。
所属事件:Meta 提出「锐化税」:RL 后训练削弱大模型测试时扩展能力(5 条相关)→
「编程与Agent」频道最新
- 知名博主:不支持 API/MCP 的应用我现在直接不注册 — nateliason · 2026-10-04
- 用 Agent 技能一周融资研究压缩成一次运行:自动排查冲突投资人 — MartinGTobias · 2026-10-04
- 用上万个并行 agent 同时开发多个应用,卡在协调难题上 — real_serviceloom · 2026-10-04
- 开发者做 AgentTerm 把终端 CLI 会话扩展成可视化工作区 — AIIDreamNoDrive · 2026-10-04
- 公司接入 MCP 服务器后,审计日志里 40 张变更单全算在服务账号头上 — MityFourDoor · 2026-10-04
- 观点:AI 时代应更多使用抽象,用 lint 规则约束 agent 决策空间 — mattpocockuk · 2026-10-04