ProVer 论文:让 LLM 裁判定位关键步骤,Agent RL 超 GRPO 9.9%
omarsar0 · x · 2026-10-02
Elvis Saravia 推荐一篇关于 Agent 强化学习中信用分配的好论文 ProVer。
- 问题:GRPO 给轨迹中每个 token 相同的优势值,训练信号无法区分决定性步骤与其他步骤。
- 方法:由 LLM 裁判比较成功与失败的 rollout,指出造成差异的关键片段;然后从该片段前后分别采样续写,用成功率的变化作为该片段的优势估计。
- 结果:在 ALFWorld、WebShop、SearchQA 上,相对 GRPO 分别提升 9.91%(Qwen3.5-2B)和 7.12%(Qwen3.5-4B),且裁判用更小模型也依然有效。
「编程与Agent」频道最新
- 别再依赖关键词黑名单:agent 用一行 Python concat 即可绕过 — rchardkovacs · 2026-10-02
- PewDiePie 开源项目 Odysseus 获 88.5k 星,公开招募维护者 — ben_burtenshaw · 2026-10-02
- Grok Build v1.0.48 更新:并行工具调用更可控、取消不再误杀任务 — XFreeze · 2026-10-02
- 「决策模型」大战:OpenAI、Perplexity 紧急跟进 Jev — bendee983 · 2026-10-02
- 职业 agent 开发者:最难的不是模型,是失败路径与交接 — jakes_takes_ · 2026-10-02
- remilouf 预告历时 6 个月打造、自称「彻底改变游戏规则」的 agent 产品 — remilouf · 2026-10-02