3595 条回复复测 15 个模型:上次的两条爆点结论全部翻车

nejcar20 · reddit · 2026-09-03

一个照片冲印店客服自动化团队复测了两周前的模型评测:15 个模型、8 个案例、每案例 30 次生成、斯洛文尼亚语+英语,共 3,595 条打分回复。

上次的爆点结论没能复现——Claude Haiku 把 9.00 报成 9.60 的经典失败在 240 次尝试中一次未再现,GPT-4o mini 偏差 4 倍的错误也没有再发生。作者承认单样本结论发布得太草率。

但发现了更隐蔽的问题:GPT-4o mini 在价格阶梯边界处(99 张应报 31.68 欧元)连续 30/30 次报出 29.70(按上一档单价算),且中英文均如此——不是随机错误,而是稳定误读。更糟的是这类「安静错误」(审查者看不出来的错误)达每千条回复 250 次,而「响亮错误」为零。

准确率已无法区分模型:15 个模型中 10 个全对。最便宜的 Ling 3.0 Flash(0.000024 美元/条)236 条全对,而同样全对的 Claude Haiku 单条成本是它的 89 倍。

盲测写作评分(120 条、去除模型身份)发现唯一有区分度的维度是「是否展示计算过程」:GPT-5.6 Luna 和 Grok 4.3 都只给裸总价,无可核对的依据——而 Luna 正是他们据此轮结果选定的生产默认模型。作者也坦承两个削弱因素:展示过程与回复长度相关性 0.85,且盲评由 Claude 完成、Claude Haiku 也在被测之列。

他们还在自己评分器里发现一个 bug(价格中的「15」被误当候选数字),并指出 30 次生成买到的稳定性超预期:101/120 个单元格内 30 次结论一致,平均一致性 97%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →