Composio 评测显示编程 harness 成功率接近,但速度差距很大
Teknium · x · 2026-07-29
Composio 的对比显示,三种 coding harness 的 成功率接近,但速度和 token 效率差别很大。
- Kimi Code:22/28
- Hermes:21/28
- Claude Code:20/28
真正拉开差距的是耗时:
- Hermes 的任务中位时间只有 179 秒
- Kimi Code 为 297 秒
- Claude Code 为 348 秒
结论很直接:最快的 harness 和 最省 token 的 harness 并不是同一个。
「编程与Agent」频道最新
- Relume MCP 结合 Claude Code 的 Markdown 设计工作流 — michalmalewicz · 2026-07-29
- 一场研究演讲比较了 agentic coding 的三类基准 — OfirPress · 2026-07-29
- Kuna 亮相为智能体驱动反编译器,结构化排名逼近 Hex-Rays — moyix · 2026-07-29
- 10万美元对赌:AI编程写不出Ahrefs级SEO工具 — eptwts · 2026-07-29
- 一家 AI agent 创业公司主张:计费应基于事实,而不是散落的 API 调用 — davidcrawshaw · 2026-07-29
- Cursor 多数用户仍只当补全器用,母公司估值已达 293 亿美元 — nikola_mr64990 · 2026-07-29