后训练Agent开跑即锁策略,1338条轨迹仅2.1%换路线

What is Missing from AI Post-Training AI: An Empirical Analysis

Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin

cs.AI, cs.CL, cs.LG

2026-08-20

分析1338条公开后训练轨迹:Claude八成锁在全参SFT、Codex九成锁在PEFT,经验脚手架把HumanEval从22分拉到62.8,策略建议一次都没被采纳。

这篇在解决什么

Agent 已经能端到端做 LLM 后训练:写代码、起训练、评 checkpoint、修 bug。PostTrainBench 把这件事做成标准考场,前沿 Agent 在 10 小时预算里确实能把下游分数拉上去。圈内讨论容易把「能跑完训练」当成「能自己做 AI 研发」。

这篇把能力拆成两层。执行层是在既定策略里迭代:调学习率、改数据格式、修奖励、换 checkpoint。策略层是根据实验证据改高阶判断:换训练范式、加减阶段、把剩余预算改投别处。分析对象是公开放出的 1338 条轨迹,覆盖 7 个基准、4 个 1.7B 到 4B 基座、20 种 Agent 配置。每条轨迹对应一张 H100、10 小时。

策略在写第一行代码之前就锁死了,剩下的预算全花在局部微调上。

方法

先在已有轨迹上做标注。一次「训练实验」必须真正更新了模型参数;写脚本、装包、评测都不算。相邻两次训练之间,只有换了训练范式、数据源类型或阶段结构才算策略变更,其余全算执行变更。标注先由 LLM 根据命令和上下文打标,作者再复核。

然后用三档加码干预,基座固定为 Qwen3-1.7B-Base,任务按难度排成 GSM8K、HumanEval、AIME 2025。自主基线是 Claude Code(Opus 4.6 和 GLM-5.2)和 Codex CLI(GPT-5.2)。干预一律叠在 Claude Code 加 Opus 4.6 上,每组独立跑 3 次,10 小时、4 张 A800。设计意图很明确:如果锁死是因为缺信息、缺人、或缺思考,加码之后策略就该动。

结果

公开轨迹已经说明执行层不弱:平均每条轨迹 3.82 次训练、13.80 次评测,7 个基准相对基座都有平均提升,总体从 10.41% 到 23.0%。策略层几乎不动。

配置默认策略策略变更率
Claude Code全参 SFT 80.7%4.7%
Codex CLIPEFT 89.6%1.6%
OpenCode全参 SFT 66.3%0.4%

3557 对相邻训练里只有 74 对(2.1%)试过别的路线,来自 44 条轨迹。同一任务上 Claude 默认全参 SFT,Codex 默认 PEFT,锁的是 Agent 先验,不是任务。

受控实验里,经验脚手架把执行做厚了:

设置GSM8KHumanEvalAIME 2025
基座10.84%5.48%0.00%
官方 instruct88.70%66.46%33.33%
Opus 4.6 自主64.70%22.00%3.33%
经验脚手架77.30%62.80%5.56%

HumanEval 从 22.0 拉到 62.8,离官方 instruct 的 66.46 只差几分。拆掉 evaluator 掉得最狠,HumanEval 落到 42.60。但策略建议零次被采纳:HumanEval 上 evaluator 9 轮里 7 轮建议改 RL,主 Agent 写了 GRPO 脚本,仍连开 14 个 SFT 变体;AIME 上建议加 SFT warm-up 三次,主 Agent 继续只做 GRPO。执行层建议 8 条里 8 条照单全收。Agent 也没新建任何 skill,尽管库里带着 create-skill。

人工指导能改开局。AIME 最佳 run 的 pass@8 从基线 3.33%、脚手架 6.67% 升到 13.33%。Agent 甚至自己判断格式已经够用,把审稿人要求的 SFT warm-up 跳过了。开训之后又缩回局部循环,后期多半在调怎么从旧 checkpoint resume。AIME 上脚手架花了 7.9 倍 token,约 6670 万 token 换多解 1 题,落在评测方差里。

为什么重要

对做 Agent 系统的人,这是一条很具体的诊断。文档、开局指导和额外 thinking token 都试过了,过不了策略锁死。策略只在第一次训练之前那一小段窗口里是软的;窗口一关,同样的经验、建议和算力全部失效。

现在所谓的 AI-for-AI 闭环,只在执行层闭合。流程是局部迭代、全局线性:从初始策略一路走到最终 checkpoint,中途几乎不回头。10 小时可以在错误策略里高效空转。想抬天花板,优先该改决策点上的训练信号和交互协议,把「重开策略」做成显式、被奖励的动作。换更大的模型解决不了「肯不肯发起改道」这件事。

局限与存疑

策略变更靠 LLM 标注再人工复核,边界定义(范式、数据源、阶段)会漏掉一些灰色改动。AIME 只有 30 题,差 1 题就是 3.33 分,论文自己也说 pass@8 的分差落在方差里,人工指导的数字不能当硬胜。干预只叠在 Opus 4.6 加 Claude Code 上,三条独立 run,泛化到别的脚手架还没验证。人只在开训前介入一次,测的不是持续 human-in-the-loop。论文也写了:频繁换策略本身不一定更好,切换有真实算力成本。缺的是「该不该换」的证据比较,不是换得越多越好。

基座停在 1.7B 到 4B。大模型上策略空间更贵,锁死会不会更严重,或执行层修复会不会反过来更强,这篇没测。

术语

原文与代码

社区讨论

相关论文

全部论文解读