同模型不同 Harness 成本差 17 倍:9 款 Agent 框架 360 次实测
Double-Entertainer62 · reddit · 2026-09-10
FrontierHarness 用同一模型、同一任务、同一运行时对 Pi、Exo、Claude Code、Codex、DeepSeek Harness 等 9 个 agent harness 做了 360 次运行、20 亿 token 的测试。
- 通过率:50% 到 67%,Claude Code 与 DSH Creator 均通过 19/30 任务并列第一
- 单次通过成本中位数:$18.34 vs $3.28,相差 17 倍
- 关键洞察:单次成功运行成本低不代表整体便宜,失败的尝试、重试和人工清理都计入总成本;应按「总花费 ÷ 实际被接受任务数」核算,并同时追踪耗时和人工干预
选型建议:不想操心选 Codex(最高通过率、中等成本);同一任务跑上千次选 Pi;重试便宜、宁早放弃选 Exo;在意墙钟时间且爱调参选 DSH。
「编程与Agent」频道最新
- kafka-mcp 上线:让 LLM Agent 检查 Kafka 主题并安全重置消费位点 — modelcontextprotocol · 2026-09-10
- 开源 agent eve 上线一等公民记忆,支持跨会话保留上下文 — cramforce · 2026-09-10
- HuggingFace 推出 ML Intern:对话式智能体替你跑完整训练流程 — Thom_Wolf · 2026-09-10
- Merge 上线 Agent Handler:一次无认证请求即可为 AI agent 开通数千工具 — shensi · 2026-09-10
- 别靠 prompt 猜运动:用 Blender 3D 动画锁定 AI 视频生成轨迹 — round · 2026-09-10
- 餐厅 POS 分析 Agent 实战:route→fetch→narrate→ground 四步架构求挑刺 — RedaHaloubi · 2026-09-10