研究显示 Agent 框架差异可使 SWE-bench 成功率从 61% 升至 75%
Merge API 用同一模型 DeepSeek V4.1 Flash 跑 30 个 SWE-bench Lite 任务,横评 5 种 coding-agent harness,发现成功率可从 61% 提升到 75%。xiyenlp 团队同期发布论文与网站,对 SWE-bench 类 agent harness 做系统的成本与性能分析,指出更多算力不等于更准,不同框架间成本差异巨大。
2026-09-30 ~ 2026-10-01 · 2 条相关
- 同一模型换 5 种 Agent 框架,SWE-bench 成功率从 61% 提至 75% — shensi · 2026-09-30
- 新研究:更多算力不等于更准,Agent 评测框架成本差异巨大 — xiye_nlp · 2026-10-01