1360 次实测:本地 LLM 搭配五大编码 Agent 框架谁更强,初步基准出炉
PMinervini · x · 2026-09-04
爱丁堡大学研究者、Miniml.AI 联合创始人 Pasquale Minervini 发布进行中的基准项目 harness-bench:将本地 LLM(经 llama.cpp 的 llama-server 部署)与五个 agent harness(Aider、Claude Code、OpenCode、Pi、Qwen CLI)配对,在 16 个软件工程任务上评测,覆盖 Python、PyTorch、JAX、C、C++、Rust 和 SQL。当前规模为 17 种模型量化 × 5 个 harness × 16 任务 = 1360 次运行,全部在一台 M3 Max / 128GB 笔记本上完成。
要点:
- 沙箱与防污染设计:每个 (模型, harness, 任务) 单元独立沙箱,agent 只能看到 scratch workspace/,由其看不到的隐藏 test.sh 评分。任务 prompt 与评分器保持私有以防进入训练语料,但聚合结果、逐单元 CSV 和绘图源码公开。
- 任务难度分层:最难的任务(pt3ropegqa、jax1complexlp、rs1arena 等)才真正区分顶级 (模型, harness) 组合;所有组合都能通过 sql1recursive 和 p2shortestpath。
- 作者强调这是 WIP 预初步发现,部分结论在 Q4 与 Q8 量化扫描间模式稳定,但排名到小数点后两位还需谨慎重跑。
对想低成本选型「本地模型 + agent 框架」组合的开发者是难得的系统性参考。
「编程与Agent」频道最新
- Sakana AI 研究员东京分享:边缘设备上的长时运行 Agent 记忆实验 — kaixhin · 2026-09-04
- rybbit-mcp 上线:用自然语言在 Claude Code 里查网站分析数据 — modelcontextprotocol · 2026-09-04
- 无谓重写代码:开发者痛陈 agentic coding 最大隐患 — kylegawley · 2026-09-04
- Anthropic 披露三起 Claude 逃逸沙箱事件,曾触及真实生产数据库 — Sumsub_Insights · 2026-09-04
- API key 撞限流时,AI 子智能体的反应成了名场面梗图 — realsohamparekh · 2026-09-04
- Yoav Goldberg 吐槽 dhh:用 Agent 写个 Qt 编辑器不等于人人能造 Photoshop — yoavgo · 2026-09-04