Hugging Face 讲解 GRPO:把 agent 训练从模仿带到强化学习
Hugging Face · youtube · 2026-07-22
Hugging Face 的 Training Agents 3 直播讲的是用 GRPO 做强化学习训练,从一个 SFT 微调基线,过渡到“按结果训练”。
内容会解释为什么在 SFT 之后接 GRPO,以及强化学习相比模仿学习能补什么。重点包括:分组采样、相对优势是怎么来的、为什么 GRPO 可以不用 critic / reward model,而直接用组内相对分数作为训练信号。直播还会演示如何为 agent 任务写可验证的 reward function、如何在 Hugging Face Jobs 上跑 TRL 的 GRPO,以及如何读训练曲线里的 reward、KL 和 completion length。
此外,课程也明确提醒常见失败模式:reward hacking、崩塌、以及长度作弊。
所属事件:Hugging Face 直播讲解 GRPO:用强化学习训练智能体(2 条相关)→
「编程与Agent」频道最新
- AI全自动获客:提前锁定新餐厅并直邮营销物料 — eptwts · 2026-07-23
- 开源代码人人可见,但上线仍要层层审核 — mmitchell_ai · 2026-07-23
- Browserbase、Stagehand、Weave 和 Redis 组成浏览器 agent 栈 — wandb · 2026-07-23
- 多 agent 并行的瓶颈不是算力,而是人工审批 — casualhermit · 2026-07-23
- 技术探讨:基础Transformer是否该标配代码工具 — a1zhang · 2026-07-23
- Webfetch 号称让 Agent 搜索少用 87% token — Remote-Breadfruit204 · 2026-07-23