新研究:更多算力不等于更准,Agent 评测框架成本差异巨大
xiye_nlp · x · 2026-10-01
研究者 xiyenlp 团队发布论文与网站,对 SWE-bench 类 agent harness 进行成本与性能的系统分析,由其学生主导完成。
关键发现:
- 不同 harness 之间成本差异极大,相似性能可能付出天差地别的代价
- 更多计算并不总是带来更高准确率
- mini-swe 表现突出:以接近直接推理的成本取得了最佳性能
对做 agent 工程的人而言,这篇分析说明「选对 harness」本身就是重要的成本优化手段。
所属事件:研究显示 Agent 框架差异可使 SWE-bench 成功率从 61% 升至 75%(2 条相关)→
「编程与Agent」频道最新
- MiniMax 预告新起点:MiniMax Code 不止于写代码 — iamaliveix · 2026-10-01
- 开源项目 headcount 给 AI 配 172 个「数字员工」,16 部门文本文件组成虚拟公司 — alex_verem · 2026-10-01
- AI agent 生成的 Supabase RLS 策略看似安全实则漏,开发者自建 CLI 扫出 12 个高危项 — Real_KingZeotic · 2026-10-01
- AI 智能体每 15 分钟刷一次,13 小时抢到东京 6 座满位餐厅 — armand_ruiz · 2026-10-01
- Higgsfield 接入 ChatGPT 扩展,可在 Codex 内端到端自动化创作 — SimplyAnnisa · 2026-10-01
- LibraryDesignBench:让 AI 设计库、再用它写代码,考察 Agent 能否用好库 — a1zhang · 2026-10-01