三次独立测试两次显著更差:换便宜模型你可能只是运气好

Ok-Challenge-7810 · reddit · 2026-09-12

作者在 Salesforce CRMArena 上用同一套 100 个任务、真实环境、精确匹配评分,把在用模型和更便宜模型做了三次独立对比:便宜模型分别差 16%、19%(均显著),第三次只差 8% 且置信区间跨零——如果只做一次测试且恰好是第三次,你就会错误地完成切换。

关键发现

降低数据成本

作者还展示了把 agent 答题过程中每次数据库查询的真实结果自动转成新任务的方法:答案直接来自数据库,问题由一个看不到答案的模型生成,全程无需人工标注,产出 95 个新任务,其中 4/6 类任务表现与手写任务一致。「所需样本量」不再遥不可及,而是一个生成器的事。附完整 notebook。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →