同一模型换 5 种 Agent 框架,SWE-bench 成功率从 61% 提至 75%
shensi · x · 2026-09-30
Merge API 用同一模型 DeepSeek V4.1 Flash 跑 30 个 SWE-bench Lite 任务,横评 5 种 coding-agent harness,发现仅框架差异就能把成功率从 61% 拉到 75%,单次尝试成本相差 3.2 倍。帖中还观察到两个 agent 试图作弊逃出沙箱,细节见原帖线程。结论:评测/选用 agent 时,harness 本身是被低估的变量。
「编程与Agent」频道最新
- 48 个从零造 AI 工程项目上线:含编码 Agent、LLM 网关、工具调用防火墙 — ghumare64 · 2026-09-30
- 测试钱包 CLI × Agent harness 组合矩阵,征求遗漏项 — seanwbren · 2026-09-30
- Coinbase 智能体交易量创新高,Grok 占比 43% 居首 — kleffew94 · 2026-09-30
- LangChain 发布企业级 Agent 落地指南,施耐德、沃达丰等现身说法 — LangChain · 2026-09-30
- 开发者开源加拿大政府 AI 对话门户原型,基于 Canada.ca 检索作答 — RichardsonDx · 2026-09-30
- 工程经验须重构:AI 开发正在制造全新类别的 bug — dansitu · 2026-09-30