实测揭示 Agent 套壳成本陷阱:选错 harness Token 消耗差 30 倍
aigclink · x · 2026-07-30
Composio 近期针对大模型与 Agent harness(套壳/框架)的组合进行了成本与性能测试,揭示了当前 AI 编码领域的几个核心趋势:
- Harness 是成本黑洞:在 Kimi K3 跑 28 个相同任务时,Claude Code、Hermes 和 Kimi Code 三种 harness 的成功率相近,但 Token 消耗最高相差 30 倍。这表明选错外壳会让账单翻几十倍。
- 开源追平闭源:在 14 项智能体基准测试中,开源的 Kimi K3 与闭源的 Claude Sonnet 5 成绩完全一致(9 通过 5 失败),差异仅体现在成本上。
- 闭源内部竞争:在 23 项任务中,GPT-5.6 Sol 击败 Opus 5(通过率 22/23 vs 20/23),且速度更快、成本更低。
随着顶级模型在“能不能做完”上的差距缩小,竞争正回归商业本质:Token 花费、耗时与最终成本。
所属事件:实测揭示Agent框架成本差异:Claude Code Token消耗远超同类(5 条相关)→
「编程与Agent」频道最新
- Astryx 提出 Vibe Test:用自动化跑分评估 AI 编码智能体 — Vjeux · 2026-07-31
- LLM Agent可观测性实战:OpenTelemetry埋坑与解决方案 — frisbeema52 · 2026-07-31
- AI 金融实战资源指南:筛选 12 门优质课程与工具 — kavirkaycee · 2026-07-31
- 工程师反思 AI 删库事件:错在人类越权,而非模型本身 — JFPuget · 2026-07-31
- 当 AI 智能体学会反驳用户,开发者感叹大功告成 — lucasmeijer · 2026-07-31
- Opus 5多智能体循环12小时生成Pokemon,代码已开源 — Successful-Earth678 · 2026-07-31