SIS:把离策略Token转回On-Policy

青稞AI · wechat · 2026-07-11

## 核心问题 文章讨论 LLM RL 后训练中的 **off-policy** 问题:严格 on-policy 采样虽然理论上最稳,但每步都要重新 rollout,成本太高;工程上常用异步 rollout、样本复用后,训练数据会来自“慢半拍”的旧策略,带来分布漂移、梯度有偏和训练不稳定。 ## 传统做法的局限 主流方法通常靠 **重要性采样** 做修正,但在长序列里整条序列的重要性比值会指数级爆炸或衰减,所以工程上往往退化成逐 token 的近似,再配合各种 **clipping**(如 GRPO clip、DAPO clip-higher、GSPO 等)来压住极端比值。代价是:稳定性提高了,但很多高偏移 token 的信号也被截掉了。 ## 新方法:SIS 作者提出 **Selective Importance Sampling, SIS**,改成用 **token 级 Rejection Sampling**: - 从旧策略采样到的 token,按当前策略与旧策略的比值做接受/拒绝判断; - 被接受的 token,在条件分布上可视为 **on-policy**,因此不需要再做重要性修正; - 被拒绝的 token 则继续走普通修正流程。 文章强调,SIS 可以直接作为一个 plug-in,塞进 GRPO、DAPO、GSPO 等现有 policy gradient 目标中。 ## 工程实现与理论性质 为了降低开销,作者用 **Top-K 近似** 来避免全词表最大比值计算;由于 LLM 分布很集中,这个近似的额外误差可由 top-K 外 tail 质量衡量。文中声称额外耗时约 **1%**。 理论上,SIS 不保证整个梯度完全无偏,但它能让接受分支上的 token 变成 on-policy,并且相较 vanilla token-level importance sampling,向真实梯度的偏差上界会被收紧。 ## 实验与现象 作者给出多组实验结论: - 在 **三种 backbone、三种算法、十个 benchmark** 上整体涨点; - 对比 GRPO,**SIS(vanilla)** 已经能取得明显提升;再叠加 DAPO 的 clip-higher,效果最好; - 在 **stale rollout** 场景下,SIS 比 baseline 更稳、退化更小; - 在 **MoE 路由 mismatch** 场景下,SIS 与 R3 可互补,组合后稳定性和准确率最好。 ## 可解释性观察 作者还分析了接受/拒绝 token 的差异: - 被接受的 token 更偏数学推理相关(如 `frac`、`sqrt`); - 被拒绝的 token 更偏格式字符和网页 artifact(如 `image`、markdown 标记)。 总体上,文章把 off-policy 处理思路从“压制偏离”转成“把部分 token 转回 on-policy”,主打简单、通用、可叠加。

所属事件:SIS 以逐 token 校正缓解离策略训练(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →