同模型不同脚手架分差 11%,Agent 工程决定上限

testingcatalog · x · 2026-08-29

数据分析显示,同一个模型(如 GPT-5.6 Luna)在三个不同的测试 harness 下,分数波动可达 11 个百分点(33.6% vs 44.9%)。这一差距甚至超过了榜单第二名与第八名之间的差距。这表明在长周期的电商任务中,围绕模型的脚手架对结果的影响与模型本身能力一样大。在该阶段,人类仍做关键决策,Agent 执行部分任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →