Hugging Face 讲解 GRPO:把 agent 训练从模仿带到强化学习

Hugging Face · youtube · 2026-07-22

Hugging Face 的 Training Agents 3 直播讲的是用 GRPO 做强化学习训练,从一个 SFT 微调基线,过渡到“按结果训练”。

内容会解释为什么在 SFT 之后接 GRPO,以及强化学习相比模仿学习能补什么。重点包括:分组采样、相对优势是怎么来的、为什么 GRPO 可以不用 critic / reward model,而直接用组内相对分数作为训练信号。直播还会演示如何为 agent 任务写可验证的 reward function、如何在 Hugging Face Jobs 上跑 TRL 的 GRPO,以及如何读训练曲线里的 reward、KL 和 completion length。

此外,课程也明确提醒常见失败模式:reward hacking、崩塌、以及长度作弊。

所属事件:Hugging Face 直播讲解 GRPO:用强化学习训练智能体(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →