编码 Agent 的钱都花在查文档:Openbenchmarks 搜索基准出炉,Tiny_Fish 成本最优
Scobleizer · x · 2026-09-10
Openbenchmarks 发布「Web Search for Coding Agents」基准(2026):用 100 个真实工单测试各搜索 API,agent 拿到现有代码后必须自行检索厂商官方文档才能补丁,任务里不透露关键实现细节,且要求补丁编译通过、引用的 URL 必须真实出现在当次搜索结果中,无法靠模型记忆作弊。
核心发现:编程是当前 AI agent 的头号用例,但大部分 token 预算不是花在写代码,而是写代码前搜索 API 文档、changelog 和最佳实践。搜索环节正是成本与质量的冲突点——省 token 掉精度,保精度账单爆炸。
TinyFish 的成绩:在该 search-and-fetch 榜单从第 7 升到第 3,token 效率与单任务成本第一,超越 Perplexity、Parallel Web Systems,逼近 Exa;两周前改版后任务完成率从 69% 提到 79%,距榜首 Exa Deep 仅 4 个百分点,但 token 少用 46%、单任务成本低约 60%,前三名里无人能及它的成本水平。
「编程与Agent」频道最新
- DeepSeek 新开源模型实测碾压 GLM 与 Kimi,便宜 4-10 倍 — deedydas · 2026-09-10
- 开源工具 FitGate:让 Claude Code 批准权限前先做完一组健身 — StudyLabsIndia · 2026-09-10
- LLM 助力 6 年反编译,《任天堂大乱斗 DX》登陆 Meta Quest MR — NathanpmYoung · 2026-09-10
- Chatbot 与 Agent 的分水岭只有一个:function calling — Al_Grigor · 2026-09-10
- Anthropic 官方省钱指南中一招反致成本高出 74% — Brinvik · 2026-09-10
- OpenClaw 云端多人会话:浏览器里联机玩扫雷演示 — vincent_koc · 2026-09-10