Webfetch 号称让 Agent 搜索少用 87% token
Remote-Breadfruit204 · reddit · 2026-07-23
Webfetch 号称把 Agent 搜索 token 压到原来的 13%
这条 Reddit 介绍了一个叫 webfetch 的本地网页搜索插件,目标是替代 Anthropic / OpenAI 这类托管搜索。作者称它在 SimpleQA 上能做到和托管搜索相同的 96% 准确率,但只用 13% 的 token、总成本降低 66%。
主要做法
- 先用 4 个搜索引擎做 RRF 融合,再抓取本地网页。
- 检索链路采用 BM25 + bi-encoder + cross-encoder reranker。
- 做了 句子级压缩,把结果 token 大约减半,且作者没有观察到召回损失。
- 引入 语义缓存:像“what did TypeScript 5.9 add”和“TypeScript 5.9 new features”这类改写问题,会先做 embedding 匹配,再用 NLI cross-encoder 验证;缓存 TTL 还会随答案时效性自适应调整。
- 每条缓存结果都保留来源;模型如果不信任缓存,可以强制重新搜索。
量化收益
作者给出的一个测试循环里只有 16 次 web search,就已经省下约 $1.49,其中包括托管搜索费用和上下文 token 成本。
项目可通过 PyPI 安装,也支持一条命令作为 MCP server 接入。
所属事件:开源 Webfetch 助力智能体搜索降本增效(4 条相关)→
「编程与Agent」频道最新
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11