专题 · FULL STORY
编码智能体大比拼:成本与开源新王的崛起
Composio 团队发布编码智能体成本测试,揭示不同框架间高达数十倍的消耗差异。随后实测焦点转向开源模型 Kimi K3,其以极低花费比肩 Opus 登顶开源,印证了轻量化与高性价比正成为 Agent 生态新趋势。
2026-07-29 ~ 2026-08-01 · 4 集 · 14 条
第 1 集 · Composio实测:Agent框架Token消耗差30倍(2026-07-29,7 条)
Composio 团队近期发布了一项针对大模型与 Agent 框架组合的成本与性能测试,揭示了 AI 编码领域的成本陷阱:在任务成功率相近的情况下,不同框架的 Token 消耗与资金成本差异巨大,最高相差达 30 倍。这表明框架本身的“套壳”开销已成为不可忽视的成本核心。
已确认
- 成功率接近:Composio 让同一个模型(Kimi K3)在 28 个相同任务下分别使用不同框架运行。测试结果显示三种框架的成功率十分接近,其中 Kimi Code 成功 22 项,Hermes 成功 21 项,Claude Code 成功 20 项。
- Token 消耗悬殊:尽管成功率相近,但 Token 消耗差距巨大。Claude Code 的中位数任务消耗约 34 万 Token,而 Kimi Code 仅约 6.1 万,两者相差约 6 倍;整体最高消耗差距可达 30 倍。开发者 rasbt 的独立测试也印证了这一点,发现 Claude Code 相比其他框架会多消耗 2-3 倍 Token。
- 单任务成本差异:结合模型定价计算,不同 Agent 的单任务成本差异显著。Hermes Agent 和 Pi Agent 在平均成本上表现最优,分别约为 0.39 美元和 0.40 美元;相比之下,Claude Code 的平均花费高达 1.47 美元,接近前者的四倍。
- 速度差异:除了 Token 效率,不同框架的执行速度也存在很大差别。
为什么重要
- Harness 是成本黑洞:测试表明,选择不同的 Agent 框架会直接导致 API 成本产生数十倍的差距。这意味着在 AI 编码应用中,框架本身的“套壳”开销已经成为不可忽视的成本核心,开发者在选型时必须将 Token 消耗效率纳入关键考量。
- Composio 评测显示编程 harness 成功率接近,但速度差距很大 — Teknium · 2026-07-29
- 实测对比:Claude Code 任务消耗 Token 约为 Kimi 的 6 倍 — zainhas · 2026-07-30
- Kimi K3实测:不同Agent框架Token消耗相差达30倍 — evijit · 2026-07-30
- 实测揭示 Agent 套壳成本陷阱:选错 harness Token 消耗差 30 倍 — aigclink · 2026-07-30
- 实测:Claude Code 跑 Agent 任务比其他框架多耗 2-3 倍 Token — RexDouglass · 2026-07-31
- 实测:不同Agent框架跑同一模型,Token消耗相差30倍 — 机器之心 · 2026-07-31
- Agent 任务成本实测:Claude Code 花费达 Hermes 近四倍 — Teknium · 2026-07-31
第 2 集 · 多款Agent框架实测:Kimi K3轻量化表现佳且具成本优势(2026-07-31,2 条)
随着 Qwen、DeepSeek 等模型大幅提升 Token 效率,开发者不再死守单一 Agent 框架。近期实测显示,在 Hermes Agent 和 OpenCode 等多款框架的对比中,国产大模型 Kimi K3 展现出优异的轻量化表现与运行效率。相比之下,Claude 等模型在完成相同任务时成本较高。
- 国产大模型 Agent 实测:Kimi K3 与 DeepSeek V4 Pro 跑分曝光 — Teknium · 2026-07-31
- 实测多款Agent框架:Kimi K3轻量化表现佳,Claude成本高 — omarsar0 · 2026-08-01
第 3 集 · 实测Kimi K3编码能力比肩Opus登顶开源(2026-08-01,2 条)
最新测试表明,Kimi K3在特定代码库上的编码表现已达到Opus 4.8水平,且使用成本远低于后者,成功登顶开源模型。该结论基于Superconductor平台通过团队真实Pull Requests构建的专属SWE-Bench测试,该工具能帮助开发者更客观地评估各类AI编程助手的实际表现。
- 实测:Kimi K3 编码能力比肩 Opus,登顶开源模型 — sergeykarayev · 2026-08-01
- Superconductor:用自有代码库实测各类 AI 编程助手 — sergeykarayev · 2026-08-01
第 4 集 · 编码智能体成本大比拼:Claude Code 花费约为开源方案 3.7 倍(2026-08-01,3 条)
Composio 发布了一项针对主流编码智能体的单次任务成本对比测试。数据显示,Hermes Agent 和 Pi Agent 的平均单次任务成本最低,分别约为 0.39 美元和 0.40 美元;而 Claude Code 的单次花费最高,达到开源方案的 3.7 倍。Box CEO Aaron Levie 指出,随着 AI 任务处理的 token 数量达到千万级,智能体外壳已成为 AI 技术栈中仅次于模型能力的关键变量。
- 编码智能体成本大比拼:Claude Code 花费约为开源方案 3.7 倍 — Teknium · 2026-08-01
- Agent 编码成本大比拼:Claude Code 单次花费达开源方案 3.7 倍 — Teknium · 2026-08-01
- 编码智能体成本大比拼:Claude Code 花费达 Pi 近四倍 — adityaag · 2026-08-01