实测打假:5款代码库工具未达60% token节省宣称
Obvious_Gap_5768 · reddit · 2026-08-06
作者针对业界多款声称能节省 60%–90% token 的代码库工具进行了严格的基准测试,发现这些宣传数据在实际 agent 工作流中根本站不住脚。
测试设置
- 基于 SWE-bench 提取 15 个 Django 问题,在 Claude Code 和 Codex 环境下进行 180 次运行。
- 确保相同的 agent、提示词和代码库版本,每次测试均重建索引。
核心发现
- Token 节省远低于预期:在 Claude Code 下,表现最好的工具仅节省约 16% 的 token,部分工具甚至与不使用工具相差无几;在 Codex 下,最高节省约 35%。
- Agent 行为差异:Claude Code 倾向于按需加载工具且经常不调用,而 Codex 则会在每个问题上调用所有工具。这表明工具的采用率更多取决于 agent 框架的运行机制,而非工具本身的设计。
- 质量无明显提升:所有工具对最终生成代码质量的提升极其有限,差异甚至低于评估器自身的噪声。
- 确定性检索测试:在无 LLM 介入的确定性检索基准中,各工具寻找目标文件的准确率差异明显,但整体构建索引的时间成本极高。
「编程与Agent」频道最新
- 用 Claude 零资产生成 3D 赛车游戏,全程代码程序化生成 — prasenx · 2026-08-06
- 仅用 19 个样本:小模型智能体蒸馏在数据效率上取得突破 — ctnzr · 2026-08-06
- YC 投资项目 Context.dev:将实时网页转化为 AI 智能体可读数据 — ycombinator · 2026-08-06
- 无需重训:OS级接口让 Qwen 计算机使用能力提升 2.5 倍 — Jackyhuang · 2026-08-06
- 观点:对话式聊天并非AI Agent的最佳交互界面 — DanWahlin · 2026-08-06
- StateAct框架:用程序状态替代像素,大幅提升智能体表现 — dl_weekly · 2026-08-06