BPCO 论文给出更稳定的 LLM PPO 训练配方,细节全公开
max_paperclips · x · 2026-09-03
研究者提出 Best-Practice Critic Optimization(BPCO),一套面向 LLM 的 critic-based RL 实用训练配方,目标是用可靠的 critic 训练替代常见踩坑实现。
- 从小模型+特意简单的小数据集起步,逐项引入稳定化手段,每个改动都配 A/B 测试与理由
- 定稿后与 vanilla PPO 和 GRPO 做消融对比,并在更大模型、更大 dataset、rubric-based rewards 三个维度上扩展实验,BPCO 在多个设置中胜出
- 作者强调「没有秘方、没有新意,只有真正重要的实现细节」,指出社区常见实现暗藏大量陷阱
论文与代码均已开源,转发者评价其研究方法论本身也值得从业者学习。
「研究」频道最新
- F. Chollet 断言 AI 必收敛于符号学习,新论文称 LLM 表征隐含符号结构 — burny_tech · 2026-09-03
- 与 Tetlock 合著新预印本:RL 奖励评分规则如何塑造 LLM 预测能力 — simonguozirui · 2026-09-03
- DeepLoop 论文让循环 Transformer 可稳定扩展,并传前沿模型为 48 层循环两次 — StartupYou · 2026-09-03
- 曝 OpenAI Astra 用「循环深度」省思考Token,监控成盲区 — 新智元 · 2026-09-03
- KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存 — kaist-ai · 2026-09-03
- NVIDIA 后训练模型在 IOI 编程竞赛超越顶级人类选手 — nvidia · 2026-09-03