评测体系遭质疑:adapter-harness-model 三元组让榜单失真

teortaxesTex · x · 2026-09-12

有人指出当前 AI 编码评测存在根本问题:我们评估的不是单纯的模型,而是「adapter-harness-model」三元组,其中 adapter(接入层)最容易被针对性调优,却很少被公开。

结论:benchmark 衡量的不是模型峰值能力,「benchmarking 问题」真实存在,榜单成绩要打折扣看。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →