本地 web search 工具称少用 87% token、成本降 66%
Remote-Breadfruit204 · reddit · 2026-07-23
本地 web search 工具宣称少 87% token、便宜 66%
作者做了一个叫 webfetch 的本地 web search 方案,目标是替代 Anthropic / OpenAI 的托管搜索。帖子先指出,托管搜索大约是 每 1,000 次搜索 10 美元,而且每次还要把约 1.7 万 token 的结果塞进上下文,成本很高。
这个方案的核心做法包括:
- 4 个搜索引擎做 RRF 融合,再抓取本地网页
- BM25 + bi-encoder 检索 + cross-encoder rerank
- 句子级压缩,把结果 token 减半且未观察到召回损失
- 语义缓存:相近提问通过 embedding 匹配,再用 NLI cross-encoder 验证
- 缓存结果保留来源,模型也可以强制重新搜索
作者称,在 SimpleQA 上它和托管搜索一样达到 96% 准确率,但 token 少 87%、成本低 66%;一次只跑了 16 次搜索的测试循环就节省了 1.5 美元。项目已可通过 PyPI 安装,并能作为 Claude Code 的 MCP server 接入。
所属事件:开源 Webfetch 助力智能体搜索降本增效(4 条相关)→
「编程与Agent」频道最新
- 现代 AI Agent 协议栈的 11 项实用地图 — TheTuringPost · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27