专题 · FULL STORY

Agent框架实测:Token消耗差异与成本优化

近期针对多款Agent框架的实测揭示了AI编码领域的成本陷阱。在任务成功率相近的情况下,不同框架Token消耗差异巨大,促使开发者转向Kimi K3等更具成本优势的轻量化方案。

2026-07-29 ~ 2026-08-01 · 2 集 · 9 条

第 1 集 · Composio实测:Agent框架Token消耗差30倍(2026-07-29,7 条)

Composio 团队近期发布了一项针对大模型与 Agent 框架组合的成本与性能测试,揭示了 AI 编码领域的成本陷阱:在任务成功率相近的情况下,不同框架的 Token 消耗与资金成本差异巨大,最高相差达 30 倍。这表明框架本身的“套壳”开销已成为不可忽视的成本核心。

已确认

  • 成功率接近:Composio 让同一个模型(Kimi K3)在 28 个相同任务下分别使用不同框架运行。测试结果显示三种框架的成功率十分接近,其中 Kimi Code 成功 22 项,Hermes 成功 21 项,Claude Code 成功 20 项。
  • Token 消耗悬殊:尽管成功率相近,但 Token 消耗差距巨大。Claude Code 的中位数任务消耗约 34 万 Token,而 Kimi Code 仅约 6.1 万,两者相差约 6 倍;整体最高消耗差距可达 30 倍。开发者 rasbt 的独立测试也印证了这一点,发现 Claude Code 相比其他框架会多消耗 2-3 倍 Token。
  • 单任务成本差异:结合模型定价计算,不同 Agent 的单任务成本差异显著。Hermes Agent 和 Pi Agent 在平均成本上表现最优,分别约为 0.39 美元和 0.40 美元;相比之下,Claude Code 的平均花费高达 1.47 美元,接近前者的四倍。
  • 速度差异:除了 Token 效率,不同框架的执行速度也存在很大差别。

为什么重要

  • Harness 是成本黑洞:测试表明,选择不同的 Agent 框架会直接导致 API 成本产生数十倍的差距。这意味着在 AI 编码应用中,框架本身的“套壳”开销已经成为不可忽视的成本核心,开发者在选型时必须将 Token 消耗效率纳入关键考量。

第 2 集 · 多款Agent框架实测:Kimi K3轻量化表现佳且具成本优势(2026-07-31,2 条)

随着 Qwen、DeepSeek 等模型大幅提升 Token 效率,开发者不再死守单一 Agent 框架。近期实测显示,在 Hermes Agent 和 OpenCode 等多款框架的对比中,国产大模型 Kimi K3 展现出优异的轻量化表现与运行效率。相比之下,Claude 等模型在完成相同任务时成本较高。