快慢训练把任务写进提示,追上RL峰值最多只需三分之一的步数

Learning, Fast and Slow: Towards LLMs That Adapt Continually

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

cs.LG, cs.AI

2026-05-13

把参数当慢权重、GEPA进化提示当快权重,与RL交错更新。Qwen3-8B上追上RL峰值最多只需约三分之一的步数,拟合渐近精度高2.9到7.7个百分点,对基座KL最多少70%。

这篇在解决什么

后训练几乎全靠改参数。SFT 或 RL 把每一次进步,可复用的推理习惯也好,最近几条 rollout 里的临时教训也好,都写进同一组慢权重。域内奖励上去的同时,策略离开基座,熵下降,OOD 变差,下一个任务变得更难学。最后这件事有名字:plasticity loss,可塑性丧失。

另一条路是参数不动,只改提示。APE、OPRO、GEPA 已经证明,重写指令能明显挪动行为。单独优化提示通常够不到改权重的上限,而且几乎总是训完再做,对着冻结的 checkpoint。

Fast-Slow Training(FST)把两条通道一起训。团队来自 UC Berkeley、Mila、UT Austin 等。慢权重是模型参数 θ,快权重是一组会进化的文本提示 Φ。

方法

慢侧跟 ScaleRL 配方:可验证奖励上的 GRPO,损失是 cispo,截断重要性采样的 REINFORCE。每题采 G=8 条 rollout,按组内均值和标准差算相对优势。快侧是 GEPA。冻结的反思模型(实验里是 gpt-5.2)读 rollout 全文,思路、工具调用、报错、文字反馈都进反思,对提示做突变,保留 Pareto 前沿上的 K 条候选,不只留一条最优。

训练按周期交错:

快通道能吃文字反馈,一条失败轨迹远不止 RLVR 那 1 bit 对错。慢通道只看标量奖励,负责把能复用的推理习惯写进参数。用种群而不是单提示,是让不同切片的题各自有擅长的上下文,GRPO 也能比较跨提示的差异。

基座几乎全是 Qwen3-8B thinking。数学那条线因为 Instruct 在 Polaris 上已经饱和,先把 Qwen3-8B-Base 在 Nemotron 上 SFT 再训。

结果

三个训练族:CodeIO(预测 Python 函数输出)、Math/Polaris、HoVer-hard(多跳事实核验)。

FST 追上 RL 当前峰值所需步数更少,拟合出的渐近精度也更高:

任务相对 RL 步数拟合渐近精度 FST / RL
CodeIO3.0× 更少47.4% / 43.0%(+4.4pp)
Math (Polaris)1.4× 更少49.2% / 46.4%(+2.9pp)
HoVer-hard3.0× 更少25.0% / 17.3%(+7.7pp)

关掉 GEPA 提示做跨域 OOD,两边几乎持平:CodeIO 训完 49.7% vs RL 的 51.1%,数学 36.5% vs 36.2%,HoVer 48.5% vs 48.4%。对应基座是 41.0%、26.9%、47.5%。

可塑性探测更刺眼。先在数学上训完,再对 HoVer-hard 开一轮全新 RL:纯 RL 初始化 40 步内掉到约 0%,FST 初始化接近从基座直接开训(基座 20.2%,FST 16.7%)。物理到 HoVer-hard 上,400 步时 FST 初始化 24.2% 还在爬,RL 初始化 19.9%。

连续学习把 HoVer、CodeIO、Physics 串进同一条 600 步轨迹,每 200 步换任务。第二段 CodeIO 最能说明问题:RL 从 18.3% 只抬到 20.7%,加 2.5 个百分点;FST 大约 80 步就接近峰值,收在 37.7%,加 19.6 个百分点,段内获取速度大约 8 倍。

通道拆解(pass@1)说明两边都在干活。HoVer-hard:慢通道单独从 2.0% 到 11.6%,快通道单独到 10.6%,合在一起 21.2%。CodeIO 联合 43.3%,慢单独 25.1%,快单独 34.5%。数学几乎全靠慢通道,从 20.0% 到 47.2%,附录把原因归到那套 SFT 基座指令跟随偏弱。

匹配奖励时,对基座的 token 级 KL 最多低 70%。合成星图寻路上,FST 大约第 50 步就离开零奖励区,纯 RL 要等到约 250 到 300 步。

为什么重要

对正在跑 RLVR 的人,这篇给的是一条叠在现成优化器上的配方,不是新损失。CISPO 和 GEPA 都能换。值得拿走的判断更窄:任务级、容易过时的信息不必写进参数。停在提示里,参数就能少挪、少忘,还能接着学下一个任务。

这和「先 RL 再调 prompt」不是同一件事。提示和策略是共进化的。naive 蒸馏把快通道信号折进参数、慢侧不再吃奖励,上限明显低于联合优化。快通道替代不了慢侧的 policy gradient。

代价也清楚。headline 配置单步墙钟约 100 秒,纯 RL 约 60 秒。把 GEPA 评估缓存拼进下一轮 RL 组,能把 RL 步压到约 47 秒,周期本身的反思调用还在。单次 headline 大约 25 到 40 个 H100 GPU 小时,gpt-5.2 反思大约每 run 不超过 10 美元。渐进改进,不是免费午餐。

局限与存疑

作者自己写了三条:只测了 CISPO 加 GEPA 这一种组合;两条循环之间的轨迹还能复用得更狠;蒸馏方向只做了 naive 一版。

图上还能再打几折。70% KL 是「最多」,数学那条线 FST 和 RL 的 KL-奖励轨迹几乎叠在一起,快通道基本没贡献。可塑性最戏剧的 0% 崩溃只出现在数学到 HoVer,物理那条线上 RL 初始化并没有死。连续学习每段只有 200 步,任务顺序固定,谈不上任意任务流。headline 全是 8B,反思模型是闭源 gpt-5.2,复现成本和供应商绑在一起。OOD 评估明确关掉了 GEPA 提示,部署时如果还想要那部分快通道增益,提示种群得跟着 checkpoint 走。

术语

原文与代码

社区讨论

相关论文

全部论文解读