同模型双 Agent 对比:45/50 分胜 43/50,耗时与成本均接近

donk8r · reddit · 2026-08-22

博主在相同条件下(deepseek-v4-flash 模型、相同提示词、无网络环境)对两个开源编码 Agent(Octomind 对比竞品)进行了 50 个任务的基准测试。结果显示:准确率分别为 45/50 和 43/50,评委平均分 88.6 对比 85.6,成本几乎相同($1.59 对 $1.53)。虽然平均耗时 Octomind 略慢,但中位数更快(5.5 分钟 vs 7.0 分钟),且在 31 个案例中胜出。平均耗时差距主要源于一个极端案例,暴露了 Octomind 的无进度检测缺陷。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →