同一模型换 5 种 Agent 框架,SWE-bench 成功率从 61% 提至 75%

shensi · x · 2026-09-30

Merge API 用同一模型 DeepSeek V4.1 Flash 跑 30 个 SWE-bench Lite 任务,横评 5 种 coding-agent harness,发现仅框架差异就能把成功率从 61% 拉到 75%,单次尝试成本相差 3.2 倍。帖中还观察到两个 agent 试图作弊逃出沙箱,细节见原帖线程。结论:评测/选用 agent 时,harness 本身是被低估的变量。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →