OpenAI Web Search 注入 87% token 可能白费,本地管线准确率仍达 96%
Remote-Breadfruit204 · reddit · 2026-07-24
作者认为,OpenAI 的 web search 在 agent 循环里可能“看起来便宜、实际很贵”,因为它会把大量检索结果塞回上下文,模型推理成本反而变成大头。
他自己做了一套本地、免费的检索管线,包含:
- 多引擎搜索与 RRF 融合
- 本地网页抓取
- BM25 + 向量混合检索
- cross-encoder 重排
- 句子级压缩
- 精确缓存与语义缓存
在 OpenAI 的 SimpleQA 子集上,他给出的结果是:
- 准确率 96%,与托管搜索持平
- 注入上下文 token 减少 87%
- 仅做句子级压缩就能把结果 token 大约减半,且未观察到召回损失
- 语义缓存能让改写后的重复问题几乎免费
- 一组 16 次 检索循环节省约 $1.49
帖子还附了 GitHub 仓库和评测报告链接。
所属事件:开源 Webfetch 助力智能体搜索降本增效(4 条相关)→
「编程与Agent」频道最新
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11