KAIST 提出 GRAFT:模型间互换轨迹,异构模型 RLVR 平均提升 2.1 分
kaist-ai · hf · 2026-09-30
KAIST AI 团队针对 RLVR(如 GRPO)中 rollout 全失败组无梯度信号的问题,提出跨模型轨迹交换框架 GRAFT。
问题与洞察
- 有限 rollout 预算下,「全失败组」无法产生基于奖励的策略梯度;增加 rollout 又推高成本。
- 异构模型往往在不同 prompt 上互补成功,无需更强 teacher 即可互相学习。
GRAFT 方法
- 用同批其他模型的「有信息量的组」替换全失败组,同时转移成功与失败响应并附带 peer 计算的优势。
- 通过序列级兼容性加权与 token 级重要性比例裁剪控制跨模型分布失配。
结果
- 在三对异构模型、五个数学推理基准上,同等 per-model rollout 预算下 GRAFT 一致优于 GRPO:模型平均性能平均 +2.1 分,最高 +4.5 分。
- 存储的 peer 轨迹离线使用也能保留大部分收益(平均 +1.8 分),无需同步共训。
「研究」频道最新
- AutoRef 开源:面向智能体多参考图生成的 Harness 优化 — NunyaBuzor · 2026-09-30
- VLANeXt Family:500+ 控制实验提炼 12 条 VLA 模型实用配方 — ccloy · 2026-09-30
- RL with Confidence Margin 论文:让置信度逐步追踪推理正确性 — EliasEskin · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍 — SouthernUniversityofScienceandTechnology · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30