南洋理工实测:换一套Harness可让Claude与GPT排名反转
机器之心 · wechat · 2026-10-04
新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》,系统研究了 Agent 应用中模型与 Harness 的适配问题。
实验将 OpenHands、DSH、PI、openJiuwen 四套 Harness 接入 Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3、DeepSeek V4 Pro 五个模型,在 TUA-Bench、ALE-CLI、Terminal-Bench4 三个任务集上交叉评测,加上 Codex–GPT 与 Claude Code–Claude 两组原生搭配,共 66 项结果。
关键发现:
- Harness 显著改变模型排名:Terminal-Bench4 上 Claude Opus 5 用 OpenHands 领先 GPT 约 8 分,换成 PI 后反被 GPT 反超 30 分。
- 五个模型中有四个的最佳 Harness 随任务变化;唯一例外是 Kimi K3,与 openJiuwen 的组合在三个任务集上均领先,原因在于拆分的工具接口、命令超时反馈和截断续写机制。
- 原生搭配并非最优:Codex–GPT 在三个任务集上均低于第三方组合。
- 成本与表现不成正比:Terminal-Bench4 上 DSH 跑 GPT 花 1,256 美元(PI 的 4.3 倍)得分反而更低;openJiuwen 缓存命中率高达 94–99%,远超其他 Harness 的 49–77%。
结论:应把模型与 Harness 作为整体、围绕真实任务联合评估,而非寻找通用排行。
「编程与Agent」频道最新
- Claude Code 子代理缓存改 1 小时未必省钱,作者实测后改回 5 分钟 — daniel_mac8 · 2026-10-11
- Image-to-WebDev 榜单:Claude Opus 5.5 登顶,价格比 GPT-6 低六成 — arena · 2026-10-11
- 开源项目 Celesto:给 AI Agent 配备专属云电脑与沙箱 — aniketmaurya · 2026-10-11
- SpIDER 论文:让编码 agent 先找对代码位置再动手修改 — mangahomanga · 2026-10-11
- AI 功能上线为何总翻车?真实流程远比想象混乱 — aakashgupta · 2026-10-11
- Perplexity Computer 编排 3 个前沿模型,用 21 万 credits 建成财报搜索应用 — AravSrinivas · 2026-10-11