SIS 以逐 token 校正缓解离策略训练
一篇新论文提出 SIS,用于缓解 LLM 强化学习后训练中复用 rollout 带来的离策略问题。该方法不再只裁剪整体比率,而是对每个 token 做重要性校正,把离策略样本尽量拉回 on-policy,在避免每步重采样高成本的同时提升训练稳定性。
2026-07-11 ~ 2026-07-12 · 2 条相关
- SIS:把离策略Token转回On-Policy — 青稞AI · 2026-07-11
- SIS让离策略token回到on-policy — burny_tech · 2026-07-12