研究显示 Agent 框架差异可使 SWE-bench 成功率从 61% 升至 75%

Merge API 用同一模型 DeepSeek V4.1 Flash 跑 30 个 SWE-bench Lite 任务,横评 5 种 coding-agent harness,发现成功率可从 61% 提升到 75%。xiyenlp 团队同期发布论文与网站,对 SWE-bench 类 agent harness 做系统的成本与性能分析,指出更多算力不等于更准,不同框架间成本差异巨大。

2026-09-30 ~ 2026-10-01 · 2 条相关