OpenAI Web Search 注入 87% token 可能白费,本地管线准确率仍达 96%
Remote-Breadfruit204 · reddit · 2026-07-24
作者认为,OpenAI 的 web search 在 agent 循环里可能“看起来便宜、实际很贵”,因为它会把大量检索结果塞回上下文,模型推理成本反而变成大头。
他自己做了一套本地、免费的检索管线,包含:
- 多引擎搜索与 RRF 融合
- 本地网页抓取
- BM25 + 向量混合检索
- cross-encoder 重排
- 句子级压缩
- 精确缓存与语义缓存
在 OpenAI 的 SimpleQA 子集上,他给出的结果是:
- 准确率 96%,与托管搜索持平
- 注入上下文 token 减少 87%
- 仅做句子级压缩就能把结果 token 大约减半,且未观察到召回损失
- 语义缓存能让改写后的重复问题几乎免费
- 一组 16 次 检索循环节省约 $1.49
帖子还附了 GitHub 仓库和评测报告链接。
所属事件:开源 Webfetch 助力智能体搜索降本增效(4 条相关)→
「编程与Agent」频道最新
- ChatGPT Voice 被用成 iPhone 远程执行工作流 — ___Patrice___ · 2026-07-24
- 一个插件让 agent 控制 Codex Micro 灯效:邮件、Stripe、子 agent 都能触发 — dkundel · 2026-07-24
- LangChain 展示 Rillet 用 LangSmith 监控 AI agents — LangChain · 2026-07-24
- localbrain 用一条命令把本地 AI 接进任意应用 — Everglow915 · 2026-07-24
- Nous Research 的 Hermes Agent 在 Buzz 里发出首条消息 — Teknium · 2026-07-24
- 开源 WordPress MCP 插件让 agent 以最小权限访问站点 — wpninjapro · 2026-07-24