RL 搜索新解:agent 花三到五成 token 在搜索,专用模型快 20 倍便宜百倍

AI Engineer · youtube · 2026-09-17

AI Engineer 频道视频,SID.ai 的 Maximilian-David Rumpf 讲 RL 如何改造 agent 搜索。

问题

传统管线的死结

经典「改写查询→后端检索→重排→返回」管线中,所有决策在设计时就已冻结,每个问题分到相同的固定算力预算;重排器常常明知结果答不上问题却无法行动,只能返回,形成靠补不完的边缘 case 堆砌的长尾失败。

RL 为何适合搜索

结果

专用 RL 模型在同任务上比 frontier 模型快约 20 倍(5 秒 vs 2 分钟),成本约为其 1/100,并把坏结果挡在主上下文之外。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →