专题 · FULL STORY
Agent框架实测:Token消耗差异与成本优化
近期针对多款Agent框架的实测揭示了AI编码领域的成本陷阱。在任务成功率相近的情况下,不同框架Token消耗差异巨大,促使开发者转向Kimi K3等更具成本优势的轻量化方案。
2026-07-29 ~ 2026-08-01 · 2 集 · 9 条
第 1 集 · Composio实测:Agent框架Token消耗差30倍(2026-07-29,7 条)
Composio 团队近期发布了一项针对大模型与 Agent 框架组合的成本与性能测试,揭示了 AI 编码领域的成本陷阱:在任务成功率相近的情况下,不同框架的 Token 消耗与资金成本差异巨大,最高相差达 30 倍。这表明框架本身的“套壳”开销已成为不可忽视的成本核心。
已确认
- 成功率接近:Composio 让同一个模型(Kimi K3)在 28 个相同任务下分别使用不同框架运行。测试结果显示三种框架的成功率十分接近,其中 Kimi Code 成功 22 项,Hermes 成功 21 项,Claude Code 成功 20 项。
- Token 消耗悬殊:尽管成功率相近,但 Token 消耗差距巨大。Claude Code 的中位数任务消耗约 34 万 Token,而 Kimi Code 仅约 6.1 万,两者相差约 6 倍;整体最高消耗差距可达 30 倍。开发者 rasbt 的独立测试也印证了这一点,发现 Claude Code 相比其他框架会多消耗 2-3 倍 Token。
- 单任务成本差异:结合模型定价计算,不同 Agent 的单任务成本差异显著。Hermes Agent 和 Pi Agent 在平均成本上表现最优,分别约为 0.39 美元和 0.40 美元;相比之下,Claude Code 的平均花费高达 1.47 美元,接近前者的四倍。
- 速度差异:除了 Token 效率,不同框架的执行速度也存在很大差别。
为什么重要
- Harness 是成本黑洞:测试表明,选择不同的 Agent 框架会直接导致 API 成本产生数十倍的差距。这意味着在 AI 编码应用中,框架本身的“套壳”开销已经成为不可忽视的成本核心,开发者在选型时必须将 Token 消耗效率纳入关键考量。
- Composio 评测显示编程 harness 成功率接近,但速度差距很大 — Teknium · 2026-07-29
- 实测对比:Claude Code 任务消耗 Token 约为 Kimi 的 6 倍 — zainhas · 2026-07-30
- Kimi K3实测:不同Agent框架Token消耗相差达30倍 — evijit · 2026-07-30
- 实测揭示 Agent 套壳成本陷阱:选错 harness Token 消耗差 30 倍 — aigclink · 2026-07-30
- 实测:Claude Code 跑 Agent 任务比其他框架多耗 2-3 倍 Token — RexDouglass · 2026-07-31
- 实测:不同Agent框架跑同一模型,Token消耗相差30倍 — 机器之心 · 2026-07-31
- Agent 任务成本实测:Claude Code 花费达 Hermes 近四倍 — Teknium · 2026-07-31
第 2 集 · 多款Agent框架实测:Kimi K3轻量化表现佳且具成本优势(2026-07-31,2 条)
随着 Qwen、DeepSeek 等模型大幅提升 Token 效率,开发者不再死守单一 Agent 框架。近期实测显示,在 Hermes Agent 和 OpenCode 等多款框架的对比中,国产大模型 Kimi K3 展现出优异的轻量化表现与运行效率。相比之下,Claude 等模型在完成相同任务时成本较高。
- 国产大模型 Agent 实测:Kimi K3 与 DeepSeek V4 Pro 跑分曝光 — Teknium · 2026-07-31
- 实测多款Agent框架:Kimi K3轻量化表现佳,Claude成本高 — omarsar0 · 2026-08-01