RL 搜索新解:agent 花三到五成 token 在搜索,专用模型快 20 倍便宜百倍
AI Engineer · youtube · 2026-09-17
AI Engineer 频道视频,SID.ai 的 Maximilian-David Rumpf 讲 RL 如何改造 agent 搜索。
问题
- Agent 的 token 消耗中约 30–50% 花在搜索上,且几乎都在任务开始阶段。
- 把任务交给 agent 而非查询交给搜索引擎,找到正确文档的几率约翻倍,但成本高 100–1000 倍、耗时从毫秒变分钟。
传统管线的死结
经典「改写查询→后端检索→重排→返回」管线中,所有决策在设计时就已冻结,每个问题分到相同的固定算力预算;重排器常常明知结果答不上问题却无法行动,只能返回,形成靠补不完的边缘 case 堆砌的长尾失败。
RL 为何适合搜索
- 奖励可验证:找没找到正确文档一翻两瞪眼。
- 环境可高频磨:每秒可试上千次。
- 作者类比计算机视觉(手工边缘检测→窄检测器→通用模型)和国际象棋(人工规则→自学习)走过的路径。
结果
专用 RL 模型在同任务上比 frontier 模型快约 20 倍(5 秒 vs 2 分钟),成本约为其 1/100,并把坏结果挡在主上下文之外。
「编程与Agent」频道最新
- 不到 8 个月:AI 从陪写简单功能到独立构建服务百万用户的大型应用 — reach_vb · 2026-09-17
- AI Engineer 搜索专场:30 岁的 BM25 成 agent 搜索基石 — jobergum · 2026-09-17
- Innate OS 开源:让普通人直观训练通用机器人的 agent 系统 — chris_j_paxton · 2026-09-17
- 安全研究员披露 Google Antigravity 0day:DNS rebinding 打穿 AI Agent 拿 RCE — evilsocket · 2026-09-17
- 省额度妙招:Astra 写计划、Luna 执行,定时巡检防跑偏 — TheMoonMidas · 2026-09-17
- 内部推理网关难管 MCP 与配置,开发者开源 blue 项目求解 — Educational-Hold9425 · 2026-09-17