不同 agent 框架成本差异巨大,mini-swe 接近直推成本拿下最佳成绩
xiye_nlp · x · 2026-10-01
作者对比多个长上下文/编码 agent harness 的评测结果显示:更多算力并不总等于更高准确率,相似性能的开销可以相差极大。
要点:
- 不同 harness 之间成本分布很宽,同一模型在不同编排下花费差异显著
- mini-swe 表现突出:以接近直接推理的成本拿到了最佳性能
- 结论是 harness 的工程编排(而非堆算力)决定了性价比
该结果出自其 LongHarness 基准评测(见同作者另一帖)。
所属事件:LongHarness 基准发布:同模型不同框架效率差距超 10 倍(2 条相关)→
「编程与Agent」频道最新
- 开源项目 headcount 给 AI 配 172 个「数字员工」,16 部门文本文件组成虚拟公司 — alex_verem · 2026-10-01
- AI agent 生成的 Supabase RLS 策略看似安全实则漏,开发者自建 CLI 扫出 12 个高危项 — Real_KingZeotic · 2026-10-01
- AI 智能体每 15 分钟刷一次,13 小时抢到东京 6 座满位餐厅 — armand_ruiz · 2026-10-01
- Higgsfield 接入 ChatGPT 扩展,可在 Codex 内端到端自动化创作 — SimplyAnnisa · 2026-10-01
- LibraryDesignBench:让 AI 设计库、再用它写代码,考察 Agent 能否用好库 — a1zhang · 2026-10-01
- 创业公司推出数字员工 Ace:配电脑、邮箱和账号,像新员工一样入职 — garrytan · 2026-10-01