1360 次实测:本地 LLM 搭配五大编码 Agent 框架谁更强,初步基准出炉

PMinervini · x · 2026-09-04

爱丁堡大学研究者、Miniml.AI 联合创始人 Pasquale Minervini 发布进行中的基准项目 harness-bench:将本地 LLM(经 llama.cpp 的 llama-server 部署)与五个 agent harness(Aider、Claude Code、OpenCode、Pi、Qwen CLI)配对,在 16 个软件工程任务上评测,覆盖 Python、PyTorch、JAX、C、C++、Rust 和 SQL。当前规模为 17 种模型量化 × 5 个 harness × 16 任务 = 1360 次运行,全部在一台 M3 Max / 128GB 笔记本上完成。

要点:

对想低成本选型「本地模型 + agent 框架」组合的开发者是难得的系统性参考。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →