Agent harness 横评:Codex、Hermes Agent、Command Code 并列第一
Teknium · x · 2026-09-17
composio 对 6 个 agent harness 做了任务成功率横评:Codex、Hermes Agent 和 Command Code 以 21/29 并列领先,Claude Code 落后一题,OpenCode 和 Pi Agent 为 19/29。
- 整体差距约 7 个百分点,说明 harness 之间差异有限。
- 29 个任务中只有 3 个任务在不同 harness 间产生了不同结果:18 个全部通过,8 个全部失败。
- Teknium(Nous Research)评价 Hermes Agent 在准确率、成本和速度上都是顶级水平。
「编程与Agent」频道最新
- 代码先行再叠自建 UI 层:一人做出定制品牌设计工具 — floguo · 2026-09-17
- 7 个模型实测:编码 agent 的 harness 不影响成功率却显著影响成本 — DavideCrapis · 2026-09-17
- 用 AI 模型 Jev 搭的交易 bot 已亏 85%,作者自嘲「还可以」 — generativist · 2026-09-17
- Reddit 用户实测 SoL-Pi 三天:记忆对象单次省 12k tokens — Garblyx · 2026-09-17
- Steve Jobs 式审美:AI 生成代码的内部也该像外壳一样美 — sergeykarayev · 2026-09-17
- 给 Gemini Astra 立 KPI:记录构建测试耗时后自动砍掉慢环节 — yacineMTB · 2026-09-17