GRPO 强化学习引入逐步 credit assignment,Qwen3-0.6B 提升到 60.7

dejavucoder · x · 2026-07-26

这篇文章在讲什么

作者尝试在 GRPO 风格的强化学习里加入更细粒度的段落级 credit assignment:追踪每个 reasoning prefix 让 scorer 对“正确答案/错误答案”的相对概率如何变化,从而得到更密集的反馈。

实验结果

计算开销

作者还做了 vLLM 的 target-span KV-cache 优化,让冻结 scorer 的运行时间从优化前的 216 分钟降到 97 分钟;基线是 93 分钟。整体结论是:更密集的学习信号可以以很小的额外开销引入。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →