Jasper Lu 开源 RL 教程:用 GRPO 从零训练搜索 Agent
dejavucoder · x · 2026-09-17
Jasper Lu 发布首篇研究博客《Training Search Agents with GRPO》,一篇面向 LLM 强化学习入门者的实战教程,全部 rollout 可浏览、代码开源。
要点:
- 基于 Harness-1 论文(Jiang et al.)的数据集与简化版搜索 harness:RL split 含 3,453 个查询、37,113 份 SEC 文件切分为 2,115,106 个 chunk;缩量消融用 256 训练查询,扩展后达 1,024 查询、237,533 chunks
- 训练通过 Thinking Machines 的 Tinker API 完成
- 核心观点:搜索是学 RL 的绝佳场景,每个超参都能直观改变模型搜索方式;设计良好的 奖励函数 对搜索行为的影响大于 system prompt 或 harness 工程
- 完整走一遍从学习率扫描到 reward shaping 的思考过程
转发者评价其为优质博客。
「编程与Agent」频道最新
- LangSmith 重建过滤体验:agent 追踪检索更快更精准 — LangChain · 2026-09-18
- LangSmith 重构 trace 过滤体验,查询更精准更快 — LangChain · 2026-09-18
- 开发者实测:最聪明模型反而写不好简单可合并的代码 — timigod · 2026-09-18
- 开发者吐槽:最聪明的模型反而不擅长写简洁可合并的代码 — timigod · 2026-09-18
- LinkedIn 工程师将展示以 PyTorch 为运行时的 GPU 检索引擎 — PyTorch · 2026-09-18
- 小模型+Kimi K3 级联路由:百封邮件欺诈检测仅花 7 美分 — nutlope · 2026-09-17