SIS让离策略token回到on-policy
burny_tech · x · 2026-07-12
- 这篇论文提出 SIS,目标是解决 LLM 强化学习里“复用 rollout 但策略已变化”的问题。
- 核心做法不是只对离策略比率做裁剪,而是逐个 token 进行检测:如果当前模型仍会采样出这个 token,就把它当作 on-policy;否则再走常规修正。
- 作者称,这样可以把一部分原本被视为离策略的 token 重新纳入 on-policy 训练。
- 把 SIS 接到 GRPO、DAPO、GSPO 后,在数学任务和 agentic search 上都有改进,并且在陈旧 rollout 和 MoE 不匹配 场景下训练更稳定。
所属事件:SIS 以逐 token 校正缓解离策略训练(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11