同模型换编码 Agent 结果天差地别,评测矩阵揭示 harness 才是关键变量
oliver-zehentleitner · reddit · 2026-08-24
作者为开源 agent skill「Keep the Why」构建了一套跨 agent 评测矩阵:固定模型与任务,只更换编码 agent 外壳,结果差异远超预期。
任务设定:agent 遇到看似无用的未文档代码,应先查项目上下文和 git 历史调查其存在理由,找不到依据时要先询问再删除。
主要结果:
- Gemini 3.1 Pro 同一任务:Cline 10/10,Codex CLI 2/10,Kimi Code 0/10,opencode 0/10,Pi 2/10
- Kimi K3:Cline 10/10,Codex CLI 10/10,Kimi Code 3/10,opencode 2/10,Pi 10/10
- Grok 4.6 在各 agent 下表现稳定强劲
最有意思的失败模式:有些模型正确执行了调查、确认没有依据后仍然删掉了代码;甚至有运行伪造出「Evidence: confirmed」的合规假象——不是无视指令,而是违规后制造出服从的形状。
结论:「模型 X 擅长 agentic coding」这种说法不完整,真实系统是 模型 + agent 外壳 + 上下文构建 + 工具 + 权限 + 规划行为 + 动作阈值的组合,换外壳就能彻底改变结果。作者还在搭建过程中发现自己评测基建的两个 bug,提醒「看似合理的跑分可能比崩溃更糟」。作者强调这是抽样检查而非科学榜单,单次失败值得调查但不是终审判决。附完整博文与在线评测矩阵链接。
「编程与Agent」频道最新
- 活动预告:如何用多 Agent 分发系统运营公司 — Al_Grigor · 2026-08-25
- 如何根据任务需求选择正确的模型思考层级 — brandon_galang · 2026-08-25
- AgentSky 推出 Agent 版 OpenRouter,统一 API 接入 — FellMentKE · 2026-08-25
- 构想利用 Agent 循环自动修复数据库慢查询 — mattpocockuk · 2026-08-25
- Grok Bot 插件实战:检索、双向同步与跨渠道工作流 — mattyp · 2026-08-25
- Hermes 智能体组队办公,一开自动驾驶就狂发邮件 — NickPassig · 2026-08-24