重要性采样为何贯穿 LLM 强化学习:PPO 与 TIS 的裁剪逻辑
cwolferesearch · x · 2026-09-11
重要性采样(importance sampling)是 RL 研究中反复出现的概念,作者解释了它的原理与在 LLM 训练中的作用。
- 核心问题:生成 rollout 的策略与当前正在优化的策略并不总是一致。PPO 会在同一批 rollout 上做多次策略更新,异步 RL 基础设施也会引入轻微过期或 off-policy 的数据。
- 原理:重要性采样允许用来自提议分布 g(x) 的样本估计目标分布 f(x) 下的期望,通过重要性比 f(x)/g(x) 修正两者差异。在 f 下更可能出现的样本获得更大的比值。
- 在 LLM RL 中的应用:PPO 用重要性比比较采样 token 在当前策略与采样策略下的概率,这是 PPO 损失函数的核心组件;当 rollout 由不同策略或不同推理引擎生成(产生略有差异的 token 分布)时,也可用重要性比来校正。
- 实践问题:当两个分布差异较大时,重要性比会变得很大,导致估计不稳定、方差高。因此 PPO 和截断重要性采样(TIS)都采用裁剪版本的重要性比,以引入偏差换取更低的方差和更好的稳定性。
所属事件:LLM 强化学习学习资源扎堆:综述长文与采样原理详解(2 条相关)→
「研究」频道最新
- 新方法将成对相互作用引入祖先序列重建 — KevinKaichuang · 2026-09-12
- 神经符号推理遭「错误但匹配判定」翻译欺骗,生成式奖励模型来救场 — CWRU · 2026-09-12
- AIRO 上线:用前沿模型自动预测 AI 灾难性风险,效果媲美人类专家 — soumitrashukla9 · 2026-09-12
- LiveBench agentic coding 评测遭质疑:4 个 Python 问题撑起异常高分 — teortaxesTex · 2026-09-12
- NVIDIA BioNeMo 跑 3100 万次蛋白质复合物预测,省约 1.35 GWh 能源 — AllThingsApx · 2026-09-12
- Greenblatt 谈 RL 环境为何 2026 比 2024 更有效 — dejavucoder · 2026-09-12