Webfetch 号称让 Agent 搜索少用 87% token
Remote-Breadfruit204 · reddit · 2026-07-23
Webfetch 号称把 Agent 搜索 token 压到原来的 13%
这条 Reddit 介绍了一个叫 webfetch 的本地网页搜索插件,目标是替代 Anthropic / OpenAI 这类托管搜索。作者称它在 SimpleQA 上能做到和托管搜索相同的 96% 准确率,但只用 13% 的 token、总成本降低 66%。
主要做法
- 先用 4 个搜索引擎做 RRF 融合,再抓取本地网页。
- 检索链路采用 BM25 + bi-encoder + cross-encoder reranker。
- 做了 句子级压缩,把结果 token 大约减半,且作者没有观察到召回损失。
- 引入 语义缓存:像“what did TypeScript 5.9 add”和“TypeScript 5.9 new features”这类改写问题,会先做 embedding 匹配,再用 NLI cross-encoder 验证;缓存 TTL 还会随答案时效性自适应调整。
- 每条缓存结果都保留来源;模型如果不信任缓存,可以强制重新搜索。
量化收益
作者给出的一个测试循环里只有 16 次 web search,就已经省下约 $1.49,其中包括托管搜索费用和上下文 token 成本。
项目可通过 PyPI 安装,也支持一条命令作为 MCP server 接入。
所属事件:本地搜索插件Webfetch号称大幅降低Agent成本(2 条相关)→
「编程与Agent」频道最新
- ASC CLI 已覆盖完整 App Store 发布流程,含 Game Center — rudrank · 2026-07-23
- Gemini 3.6 Flash 成为 Managed Agents 默认模型 — _philschmid · 2026-07-23
- 一个 Lean 形式化项目主要由 Codex 驱动完成 — burny_tech · 2026-07-23
- 持久化 AI agent 更需要 VM 快照,不只是记忆 — Theta0x33 · 2026-07-23
- Vals-Smith:将代码库转化为定制化基准测试,评估模型实际编码能力 — arrakis_ai · 2026-07-23
- Cohere社区为Ruby提供Whisper支持,含CPU/CUDA/Metal执行 — cohere · 2026-07-23