南洋理工实测:换一套Harness可让Claude与GPT排名反转

机器之心 · wechat · 2026-10-04

新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》,系统研究了 Agent 应用中模型与 Harness 的适配问题。

实验将 OpenHands、DSH、PI、openJiuwen 四套 Harness 接入 Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3、DeepSeek V4 Pro 五个模型,在 TUA-Bench、ALE-CLI、Terminal-Bench4 三个任务集上交叉评测,加上 Codex–GPT 与 Claude Code–Claude 两组原生搭配,共 66 项结果。

关键发现:

结论:应把模型与 Harness 作为整体、围绕真实任务联合评估,而非寻找通用排行。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →