编码 Agent 的钱都花在查文档:Openbenchmarks 搜索基准出炉,Tiny_Fish 成本最优

Scobleizer · x · 2026-09-10

Openbenchmarks 发布「Web Search for Coding Agents」基准(2026):用 100 个真实工单测试各搜索 API,agent 拿到现有代码后必须自行检索厂商官方文档才能补丁,任务里不透露关键实现细节,且要求补丁编译通过、引用的 URL 必须真实出现在当次搜索结果中,无法靠模型记忆作弊。

核心发现:编程是当前 AI agent 的头号用例,但大部分 token 预算不是花在写代码,而是写代码前搜索 API 文档、changelog 和最佳实践。搜索环节正是成本与质量的冲突点——省 token 掉精度,保精度账单爆炸。

TinyFish 的成绩:在该 search-and-fetch 榜单从第 7 升到第 3,token 效率与单任务成本第一,超越 Perplexity、Parallel Web Systems,逼近 Exa;两周前改版后任务完成率从 69% 提到 79%,距榜首 Exa Deep 仅 4 个百分点,但 token 少用 46%、单任务成本低约 60%,前三名里无人能及它的成本水平。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →