评测体系遭质疑:adapter-harness-model 三元组让榜单失真
teortaxesTex · x · 2026-09-12
有人指出当前 AI 编码评测存在根本问题:我们评估的不是单纯的模型,而是「adapter-harness-model」三元组,其中 adapter(接入层)最容易被针对性调优,却很少被公开。
- 作者 bnjmnmarie 举例:同一模型同一 harness,经过不同 adapter 接入,DeepSWE 这类成绩可能差异巨大
- 转发者补充:对未充分调优的模型影响更大,如 V4.1「很脆弱」,最小 harness 下成绩尚可,但针对场景优化 AGENTS.md 后提升显著
结论:benchmark 衡量的不是模型峰值能力,「benchmarking 问题」真实存在,榜单成绩要打折扣看。
「编程与Agent」频道最新
- 实战教程:GCE 上部署 3 节点 agentgateway 高可用集群 — pjausovec · 2026-09-12
- 用 GPT-6 与生成工具做游戏:蝎子骨骼动画被一键搞定 — Vjeux · 2026-09-12
- 开发者新库为 JS 带来原生共享内存多线程,主线程与 Worker 零消息协作 — Vjeux · 2026-09-12
- ChatGPT 桌面版悄悄上线标签页拖拽与预览功能 — TheMoonMidas · 2026-09-12
- 分段生成商业镜头:GPT-6 + Seedance 2.5 工作流实测 — nikola_mr64990 · 2026-09-12
- 开发者自研双环消息协议:RL 前先训练格式遵循的智能体数据 — cephaloform · 2026-09-12