三次独立测试两次显著更差:换便宜模型你可能只是运气好
Ok-Challenge-7810 · reddit · 2026-09-12
作者在 Salesforce CRMArena 上用同一套 100 个任务、真实环境、精确匹配评分,把在用模型和更便宜模型做了三次独立对比:便宜模型分别差 16%、19%(均显著),第三次只差 8% 且置信区间跨零——如果只做一次测试且恰好是第三次,你就会错误地完成切换。
关键发现
- 单次运行只能给均值,看不到方差:每任务跑 3 次后,在用模型 76% 的任务至少对一次,但只有 54% 每次都对,四分之一的任务每次结果都在翻转。这种方差藏在所有单次对比里。
- 更糟的是,vendor 榜单常用的 best-of-3 vs 单次对比会显示便宜模型还「+2% 更好」。
- 正确配对合并后:便宜模型差 16%,CI 4%–26%。且 100 任务即便三倍数据也只能说「更差」,不能说「差距在 5% 内」——不显著 ≠ 等价。
降低数据成本
作者还展示了把 agent 答题过程中每次数据库查询的真实结果自动转成新任务的方法:答案直接来自数据库,问题由一个看不到答案的模型生成,全程无需人工标注,产出 95 个新任务,其中 4/6 类任务表现与手写任务一致。「所需样本量」不再遥不可及,而是一个生成器的事。附完整 notebook。
「编程与Agent」频道最新
- Reddit 讨论:Agent 的真正瓶颈是记忆,不是模型 — Luvena21 · 2026-09-12
- 别把 Claude 当实习生使唤:8 条可直接复制的资深 AI 协作提示词 — ahuja_priyank · 2026-09-12
- Decagon 实战复盘:用 GEPA 优化生产级提示词的 19 组消融实验 — kastnerkyle · 2026-09-12
- 用 OpenEnv 把 GeoGuessr 变成 RL 环境,训出会地理定位的 4B VLM — SergioPaniego · 2026-09-12
- 中国公司用 Claude Code 造 20 多款交友 App,4700 个 AI 人设聊走 2.5 万用户 — luisdans · 2026-09-12
- 安全研究者建议:云厂商应备好防御 agent 应对失控 GPU — kuza55 · 2026-09-12