从 VPG 到 GRPO:LLM 强化学习算法演进脉络一文讲清
cwolferesearch · x · 2026-09-25
作者梳理了训练 LLM 的强化学习算法的清晰演进路线:VPG → REINFORCE → PPO → GRPO 及其变体。
- VPG:策略梯度的基础形式,提升带来高回报动作的概率、降低低回报动作的概率,通过对标准 RL 目标求梯度得到。
- REINFORCE:将期望转化为蒙特卡洛采样估计,实际可算但方差高;引入 baseline 减方差。
- Actor-Critic / PPO:用价值函数作为更有效的 baseline,同时训练 actor 与 critic;PPO 结合优势估计与保守更新,通过裁剪代理目标的重要性比率防止破坏性大更新。
- GRPO:去掉 critic 以省去额外内存、计算与复杂度,改为对同一 prompt 采样多个 completion,按组内相对奖励估计每个 completion 的优势。
文章展示了这一系谱背后「逐步降低策略梯度估计方差、降低训练开销」的内在逻辑。
所属事件:从 VPG 到 GRPO:LLM 强化学习演进综述发布(2 条相关)→
「研究」频道最新
- NeurIPS 2026 论文 SkillRL:7B 模型胜 GPT-4o 41%,靠技能进化 — cihangxie · 2026-09-25
- NVIDIA 开源 Cascade RL 获 NeurIPS Oral,IOI 银牌超越 DeepSeek-R1 — _weiping · 2026-09-25
- 研究者警告:Neuralese 潜空间推理架构将大幅加剧 AI 失对齐风险 — RyanGreenblatt · 2026-09-25
- VeriTile:用 Lean 形式化验证 Triton GPU 内核,AI 智能体自动写正确性证明 — KaiyuYang4 · 2026-09-25
- 掷骰子测出模型软肋:Jev 预测 83% 概率却只有 19% 准确率 — kh-ai · 2026-09-25
- Code Metal 设四项研究奖,单项最高 4 万美元资助形式化验证 — toddhooper · 2026-09-25