新研究:更多算力不等于更准,Agent 评测框架成本差异巨大

xiye_nlp · x · 2026-10-01

研究者 xiyenlp 团队发布论文与网站,对 SWE-bench 类 agent harness 进行成本与性能的系统分析,由其学生主导完成。

关键发现:

对做 agent 工程的人而言,这篇分析说明「选对 harness」本身就是重要的成本优化手段。

所属事件:研究显示 Agent 框架差异可使 SWE-bench 成功率从 61% 升至 75%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →