GRPO 强化学习引入逐步 credit assignment,Qwen3-0.6B 提升到 60.7
dejavucoder · x · 2026-07-26
这篇文章在讲什么
作者尝试在 GRPO 风格的强化学习里加入更细粒度的段落级 credit assignment:追踪每个 reasoning prefix 让 scorer 对“正确答案/错误答案”的相对概率如何变化,从而得到更密集的反馈。
实验结果
- 在 Countdown 任务、Qwen3-0.6B 上,使用 冻结 scorer 时,训练 30 step 后的 pass@1 从 54.7 提升到 60.7,结果来自三次独立运行,对比 GRPO 基线更好。
- 但随着训练变长,这个优势会消失:在 step 240,baseline 60.4,而 shaped 59.4。
- 使用 moving scorer 时,step 240 的表现更高,达到 63.9。
计算开销
作者还做了 vLLM 的 target-span KV-cache 优化,让冻结 scorer 的运行时间从优化前的 216 分钟降到 97 分钟;基线是 93 分钟。整体结论是:更密集的学习信号可以以很小的额外开销引入。
「编程与Agent」频道最新
- Codex 研究闲置二手价并自动生成上架列表 — kevinkern · 2026-07-26
- Codex app 被夸到“离谱”,设计和体验都更成熟了 — lucasmeijer · 2026-07-26
- 屋顶公司想把 CRM 做成 AI 经营游戏 — flngr · 2026-07-26
- GlobalGPT 推出接入 Codex 的 CLI 与 Skills、MCP — ahuja_priyank · 2026-07-26
- PinchTab 用 12MB Go 二进制给 AI agent 做浏览器控制 — Shruti_0810 · 2026-07-26
- OpenLake 用外部 KV 缓存卸载把长上下文成本砍半 — arnav__1 · 2026-07-26