同模型不同脚手架分差 11%,Agent 工程决定上限
testingcatalog · x · 2026-08-29
数据分析显示,同一个模型(如 GPT-5.6 Luna)在三个不同的测试 harness 下,分数波动可达 11 个百分点(33.6% vs 44.9%)。这一差距甚至超过了榜单第二名与第八名之间的差距。这表明在长周期的电商任务中,围绕模型的脚手架对结果的影响与模型本身能力一样大。在该阶段,人类仍做关键决策,Agent 执行部分任务。
「编程与Agent」频道最新
- 用 AI Agent 自建 OS:Dock、画布和文件管理器 — BLUECOW009 · 2026-08-29
- OpenAI Python 库弃用 Rye 迁移至 uv — charliermarsh · 2026-08-29
- Claude 智能体已能自主运行实验研究循环 — rohanpaul_ai · 2026-08-29
- 投入 1 万美元实验:用 AI Agent 设计过山车大亨乐园 — ycombinator · 2026-08-29
- 受不了查 15 个网站,他用 Agent 造了个加拿大匹克球平台 — AJChadha · 2026-08-29
- 从迭代开发转向推测性开发的范式探讨 — SawToothKernel · 2026-08-29