编码智能体横评:Kimi Code 跑赢 Claude Code 与 Codex
TheZachMueller · x · 2026-08-05
在近期针对 26 个任务的 TerminalBench 基准测试中,Kimi Code 以 21/26 的成功率夺冠,Hermius Agent 与 Pi Agent 紧随其后,而 Claude Code 和 OpenAI Codex 分别仅完成 19 个和 17 个任务。
测试发现,Codex 在处理大型工作流时表现吃力,曾两次触及 900 秒的时间限制,而 Pi Agent 仅用 446 秒就完成了相同的报销审计任务。此外,开发者往往忽视了如果不使用官方绑定的环境(例如让 Claude 脱离 Claude Code 运行),其他智能体方案可能会带来更好的效果或更高的性价比。
所属事件:实测称Agent框架选择对大模型成本影响巨大(3 条相关)→
「编程与Agent」频道最新
- 智谱系 Z.ai 开源编程 Agent 工作台 ZCode,采用 Apache 2.0 协议 — cephaloform · 2026-09-21
- 「Vibe coder 关系」或成新角色:非程序员成新模型传播主力 — venturetwins · 2026-09-21
- 分析22万次Agent工具调用:模型监督模型在进度测算好用,防攻击不可靠 — hrishioa · 2026-09-21
- 实测发现 service_tier=fast 仅限 API,ChatGPT 订阅通道不支持 — TrickyPlastic · 2026-09-21
- 视频编辑器 Powermove 发布:内核极小,一切功能皆插件,Agent 可写扩展 — round · 2026-09-21
- Reddit 网友提出用 Jev 类封闭决策模型根治数据集打标签幻觉 — Iory1998 · 2026-09-21