EasyPPO:固定 critic 让 PPO 回归 LLM 后训练,零训练崩溃
teortaxesTex · x · 2026-09-30
- EasyPPO 思路:不引入新的 actor loss、不换策略算法、actor 更新保持不变,只固定 critic,即可让 PPO 在 LLM 后训练中稳定运行。作者实验显示训练全程零崩溃,效果还优于基线。
- 为什么让 PPO 回归:转发者 wenhaocha1 解释,GRPO 难以扩展——每个任务都要烧大量 rollout。数学/编码任务的 rollout 只是多几次编译和检查,无所谓;但 RSI 类任务一次 rollout 就是一次数千美元的训练;生物领域更是没有可并行重复的实验。核心动机是从每次 rollout 里榨取更多价值。
- 团队还做了让 PPO 训练保持稳定的早期工作,开源供社区使用。
所属事件:EasyPPO 固定 Critic 解决 PPO 训练崩溃(2 条相关)→
「Infra」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- Altman:OpenAI 自研芯片 2027 上半年上线,押注推理优势 — johncoogan · 2026-09-30
- AAOI 美国垂直整合过激:激光器产线良率仍差,烧掉大量资本开支 — jwt0625 · 2026-09-30
- PrismQuant 用零空间旋转优化 INT4 量化,70B 模型几乎无损 — NanyangTechnologicalUniversity · 2026-09-30
- AI 算力吞噬全球资本,CFO 警告投资级利率或破 10% — sudoraohacker · 2026-09-30
- 字节发布 HELIX 架构:序列检索与特征交互统一建模已上线 TikTok — _reachsumit · 2026-09-30