Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
Doohyuk Jang, Yoonsik Park, Gyouk Chu, Sihwan Park, Eunho Yang
cs.LG, cs.AI, cs.CL
2026-09-29
GRAFT把全失败组换成同伴有对有错的整组轨迹,三对异构模型五个数学基准上相对同预算GRPO平均+2.1、最大+4.5,存档轨迹仍+1.8。
GRPO 这类可验证奖励强化学习(RLVR)只从模型自己采到的一组回答里学:组内相对打分,对的往上推、错的往下压。一组全对或全错时,组内方差为零,优势函数全是零,这一步就没有基于奖励的 policy-gradient 信号。
常见补救是丢掉这组、换题、改奖励形状,或者把组从 n=8 加大到 16、32。多采能提高碰到正确答案的概率,但算力跟着涨,而且仍然只靠学习者自己探到。开源模型预训练路径不同,同一道题上经常互补:独立 GRPO 里,SmolLM3-3B-Base 能解掉 Qwen3-1.7B-Base 八次全失败题目的 47.9%,Qwen3 能解掉 SmolLM3 全失败题的 18.7%,训练全程都维持着。现有跨模型方法里,HACPO 不管接收方有没有信号就到处塞同伴 rollout;SGT 只在失败时用固定权重对一条成功回答做监督损失。把这两种更新规则套到 GRAFT 选出的 prompt 上,仍然打不过 GRAFT。
GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories)同时训两个异构策略,只交换回答字符串、生成 log-prob 和奖励,参数和梯度各算各的。
换哪组:接收方八条全错,且同伴组里既有对又有错(有成功、组内奖励方差非零),才把接收方整组换成同伴整组。优势函数沿用同伴自己算好的,不把两个模型的奖励混池重标准化。双向候选数量差很多时,取较小一侧的数量 m,按同伴成功条数从高到低截断,边界同分全留,避免一边灌、一边饿。
怎么学:同伴轨迹对接收方是 off-policy,tokenizer 还可能不同。序列级兼容性比较接收方行为策略与同伴生成策略的平均 token log-likelihood,得到分数 s。s≤δ(默认 0.8)的整条丢掉;过门的权重上限为 1。正确不等于可学。token 级 importance ratio 只跟踪接收方相对自己旧策略的变化,分母不是同伴策略,再套 PPO 式非对称 clip(εlow=0.2、εhigh=0.28)。含同伴的 minibatch 放到本轮自生成数据之后再更新:第一步时 ratio 全是 1,clip 尚未生效,先吃自己的数据,再让 clip 去压同伴。
三对异构 base 模型(SmolLM3-3B、Qwen3-1.7B、OctoThinker-3B-Hybrid 两两配对),MATH 训练集 7500 题,每模型 n=8,四张 H200。评测是 MATH500、AIME2024、AIME2025、AMC23、Minerva 的 pass@1 五基准平均。对照为独立 GRPO(n=8/16/32)、HACPO、SGT。
| 被更新模型 | 同伴 | GRPO n=8 | GRAFT | Δ |
| SmolLM3-3B | Qwen3-1.7B | 32.60 | 37.06 | +4.46 |
| Qwen3-1.7B | SmolLM3-3B | 31.20 | 33.44 | +2.24 |
| Qwen3-1.7B | OctoThinker-3B | 31.20 | 32.78 | +1.58 |
| OctoThinker-3B | Qwen3-1.7B | 21.18 | 23.47 | +2.29 |
| SmolLM3-3B | OctoThinker-3B | 32.60 | 33.26 | +0.66 |
| OctoThinker-3B | SmolLM3-3B | 21.18 | 22.60 | +1.42 |
六块全部超过同预算 GRPO,平均 +2.1,最大 +4.5。Pair 1 两边都超过 GRPO n=32(SmolLM3 35.71、Qwen3 32.43);Pair 2 两边与 n=32 持平或略高。相对 HACPO 平均高 4.0 分(HACPO 六块里五块低于 GRPO,最差 -4.17),相对 SGT 高 1.5 分。三次独立训练的均值仍全部为正。
Pair 1 联合拿到双模型最优 checkpoint 花 40.9 GPU-hour,五基准均分 35.25,比 GRPO n=32 高 1.18 分、算力约 0.45 倍。存档同伴轨迹(单向、不做平衡交换)六块仍相对 GRPO +1.78,约为在线增益的 84%,双模型 checkpoint 23.2 GPU-hour,不含先前采 log 的 GRPO。Pair 3 的 SmolLM3 上存档轨迹均分 34.66,高于在线 GRAFT 的 33.26。消融里拿掉兼容性门控,SmolLM3 掉 8.36 分;只传成功样本、把两组奖励混池、同伴 minibatch 提前或打散,都低于完整 GRAFT。
这是给「全失败组没信号」的一个可落地补法:不必指定更强 teacher,也不必把组扩到 32。手里已经有一份别的模型的 GRPO log,就可以单向重放,大部分增益还在。适用场景很窄,要可验证奖励、模型异构、对方能解你解不出的题。Pair 3 增益最小,互补不够时这套几乎就是小幅改进。
对正在做数学 RLVR 的人,能带走的是两件事:失败组整组替换(含错答,保住组内对比),以及兼容性门控比「有正确答案就塞进去」更关键。HACPO 那种无筛选广撒同伴 rollout,在这套设置里会掉点。
论文自己写了:增益取决于互补程度,Pair 3 最小;跨 tokenizer 的兼容性分数是经验代理,不是密度比;只做了双模型、只做数学、只用不超过 3B 的 base。多同伴、没有可验证奖励的任务都没做。
另外几处要自己打折。checkpoint 按含评测基准的验证集每五步选最高分,所有方法同一规则,表格报的是峰值,没有单列训练终点。δ=0.8 在 Pair 1 上选定再冻到 Pair 2/3。主表是三次独立训练里的第一次,三次平均仍为正,但幅度有收缩,Pair 1 的 SmolLM3 三次均值是 +3.97,低于主表的 +4.46。没有指令微调后的模型,也没有代码或其他可验证域。HACPO 用了官方默认配置(含 KL、不同 minibatch),未必是它在这套数据上的最优形。