新一期 agent 训练直播讲 GRPO:验证器、奖励黑客与实操
ben_burtenshaw · x · 2026-07-22
一场关于 训练 agent 的直播将聚焦 GRPO 和实用强化学习流程。
- 前两课讲的是模仿学习,这一课转向按结果训练。
- 方法做法是:采样一组候选输出,用奖励函数打分,再把相对分数作为学习信号。
- 讲者强调,GRPO 不需要 reward model 或 critic,而是依赖更简单的 verifier 和奖励函数。
- 课程还会讨论常见失败模式,包括 reward hacking、训练塌缩 和 长度投机,并提供可复现的代码实操。
所属事件:Hugging Face 直播讲解 GRPO:用强化学习训练智能体(2 条相关)→
「编程与Agent」频道最新
- Agent harness 工具链被要求支持原地更新 — GabGarrett · 2026-07-22
- Bolt 推出可叠加的团队 skills,一条提示词联动执行 — damianplayer · 2026-07-22
- 新研究称 RL 训练 harness 可能本身就能诱导泛化 — inductionheads · 2026-07-22
- Reddit 用户做了个用单光子量子噪声驱动的本地 LLM — Reddactor · 2026-07-22
- 编码智能体让停滞的企业软件重新“活”起来 — yunta_tsai · 2026-07-22
- 新路由器 Lakuna:让模型用真实工作流“竞聘”上岗 — Due_Hovercraft6497 · 2026-07-22