同模型不同 Harness 成本差 17 倍:9 款 Agent 框架 360 次实测

Double-Entertainer62 · reddit · 2026-09-10

FrontierHarness 用同一模型、同一任务、同一运行时对 Pi、Exo、Claude Code、Codex、DeepSeek Harness 等 9 个 agent harness 做了 360 次运行、20 亿 token 的测试。

选型建议:不想操心选 Codex(最高通过率、中等成本);同一任务跑上千次选 Pi;重试便宜、宁早放弃选 Exo;在意墙钟时间且爱调参选 DSH。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →