电商阶段把AIME从23.3砸回6.0,冻结骨干加LoRA专家拆开遗忘

ACLArena: Agent Continue Learning in Multi-stage Post-training

Haixin Wang, Xiaoxuan Wang, Junkai Zhang, Han Zhang, Renliang Sun, Alexander K Taylor, Yidan Shi, Haoran Deng, Chenguang Wang, Jason Cong, Yizhou Sun, Wei Wang

cs.AI

2026-09-21

在Qwen3-8B上把数学、搜索、电商、指令跟随顺序后训,电商阶段把AIME从23.3砸到6.0、NQ从45.2砸到14.6。冻结SDFT骨干再给每域训LoRA-RL专家,域内接近单任务上限。

这篇在解决什么

工业级 agent 的后训几乎都是分段的:先练数学推理,再教搜索工具,再上多工具电商客服,最后压指令跟随。Qwen3、GLM-5、DeepSeek-V4 的技术报告都在这么干,但很少在同一套环境里把「顺序训完还剩多少」测清楚。

UCLA 和 UC Santa Cruz 把这件事做成了可控实验。底座是 Qwen3-8B-Base,课程固定成 Math → Search → E-commerce → IF。数学和指令跟随直接上无 critic 的 RL(GRPO 一类);搜索和电商先用拒绝采样 SFT 学会工具格式,再 RL。搜索只碰一种工具,电商最多十五种。数学数据是 DAPO-Math-17K,搜索走 Natural Questions,电商走 τ³-Bench 零售域。

顺序训不是单调叠加。Seq-Math 把 AIME26(avg@16)从 6.46 拉到 25.83,顺带把 NQ 从 13.3 带到 22.0。Seq-Search 把 NQ 拉到 45.2,AIME 还剩 23.33。电商一上,AIME 掉到 6.04,NQ 掉到 14.6,多跳搜索从 37.4 掉到 9.4,几乎退回基线。最后 IF 阶段把 IF-Eval 拉到 84.8,NQ 只救回 33.5,AIME 只救回 10.21。峰值能力没有一项被最终 checkpoint 保住。

这是真覆盖,不是评测抖动。每个阶段都把权重往自己的单任务 oracle 方向拽,四个方向只部分对齐;过的阶段越多,离对应 oracle 越远。token 层更干净:拿 Seq-Math 的一条生成冻住,让后续 checkpoint 在相同位置打分,约 94% 低熵位置几乎不动,遗忘集中在约 6% 的高熵决策点。搜什么、调哪个工具,全在那一小撮位置上被改写。

方法

他们把业界在用的三条整合路线放到同一套评测里比,再按诊断结果拼出自己的第四条。

自己的方法叫 MLE(Mixture of Low-Rank Experts)。先用 SDFT 把多域行为压进共享骨干,冻住;每个阶段再挂一个 LoRA,只在对应环境里做 RL,残差互不改写。推理时按 agent 执行上下文里的环境信息选专家,系统提示和工具 schema 在部署时本来就看得到,不需要 benchmark 名字或任务标签。

设计动机直接来自三组观察:任务更新方向只部分对齐,塞进同一套权重就会互相拆台;SFT 的参数位移大约是 RL 的 3 到 7 倍,适合铺行为、也更容易覆盖旧能力;RL 的更新局部,适合当成低秩残差。同一套 oracle 混合 SFT 从底座和从顺序终点出发,更新方向余弦 0.77,无关 SFT 任务之间只有 0.05。

结果

底座 Qwen3-8B-Base,两台 H200,每项三次独立运行。域内四项是 AIME26、NQ、τ³-Retail、IF-Eval;域外还有 GPQA-Diamond、MMLU-Redux、单跳/多跳搜索、τ³-Telecom/Mock、IF-Bench。

方法AIME26NQτ³-RetailIF-Eval
单任务 Math 专家25.8322.02.343.3
单任务 Search 专家9.7949.92.762.4
顺序训终点10.2133.529.684.8
+MMOPD21.2545.227.784.6
+SDFT22.2948.322.353.6
+均匀合并14.7939.011.874.6
MLE21.0449.732.985.0

三条后处理都只能救一部分。MMOPD 是共享权重里最均衡的折中:AIME 从 10.21 回到 21.25,NQ 到 45.2,IF-Eval 几乎不动,但电商略掉。SDFT 把多跳搜索从 25.0 拉到 38.0,IF-Eval 从 84.8 砸到 53.6,τ³-Telecom 从 45.9 砸到 21.7。均匀合并 MMLU 最高,到 80.3,电商和 IF 掉得最狠。

MLE 在四项域内都贴近对应专家:NQ 49.7 对 Search 专家 49.9,τ³-Retail 32.9 对电商专家 33.2,IF-Eval 85.0 对 IF 专家 86.2。AIME 21.04 低于 Math 专家的 25.83,但远好过顺序终点。域外它拿下 GPQA 42.4、单跳 57.7、多跳 38.6、τ³-Mock 66.7,这四项是表里最高。

单教师消融也撑得住机制。电商阶段把搜索忘光之后,用搜索 checkpoint 做 Mixed OPD,学生 NQ 从 14.6 拉到 48.4,超过原教师的 45.2,τ³-Retail 从 34.0 掉到 15.8。搜索能力不只是会调工具,还吃推理;后段 RL 把高熵判断改掉了。

为什么重要

给正在拼多阶段 agent 后训的人,这篇提供的是对照实验,不是新损失函数。Qwen3、MiMo-V2、GLM-5、Nemotron-Cascade 2、DeepSeek-V4 都在用某种 OPD 或蒸馏收口,但这篇把 OPD、离线轨迹回放、权重合并放在同一条 Math→Search→电商→IF 课上比过。结论很硬:共享权重里救回一项就会伤另一项。

如果部署时本来就能看到环境(零售客服、搜索会话、刷题),MLE 的路由几乎免费,每阶段只加一块 LoRA。如果必须压成一个权重、不能按环境切专家,MMOPD 是这篇里最不亏的共享模型方案。SDFT 适合当冷启动,不适合当最终收口。

SFT 更新大约是 RL 的 3 到 7 倍。行为克隆会大幅改写模型,RL 更像在当前策略附近打磨。这和很多实验室的体感一致,只是第一次在 agent 多阶段设定里把位移量画出来。

局限与存疑

作者自己写了两条。实验只在 Qwen3-8B-Base 和这一条固定课上做,换模型族、换顺序、加长阶段会不会还是电商最伤,没有验证。MLE 靠可观察的环境上下文选专家,上下文含糊、一轮里环境切换、或同一回合要拼多个专长,都没测。

另外几处读下来站不住。路由等于把任务身份从权重里挪到了调度器,和「一个可部署 agent」的宣传有距离;没有学出来的 router,也没有报告每阶段 LoRA 的秩、参数量和延迟。课程顺序按能力前置固定,故意不做排列实验,所以「电商特别伤」可能是排在搜索后面、工具从 1 种跳到 15 种的结果,不一定是零售任务本身。AIME26 用 avg@16,三次独立运行给了标准差,但 MLE 相对 MMOPD 在 AIME 上还低 0.21,优势集中在两个 agent 任务,数学并没有追上 Math 专家。

术语

原文与代码

相关论文

全部论文解读