3595 条回复复测 15 个模型:上次的两条爆点结论全部翻车
nejcar20 · reddit · 2026-09-03
一个照片冲印店客服自动化团队复测了两周前的模型评测:15 个模型、8 个案例、每案例 30 次生成、斯洛文尼亚语+英语,共 3,595 条打分回复。
上次的爆点结论没能复现——Claude Haiku 把 9.00 报成 9.60 的经典失败在 240 次尝试中一次未再现,GPT-4o mini 偏差 4 倍的错误也没有再发生。作者承认单样本结论发布得太草率。
但发现了更隐蔽的问题:GPT-4o mini 在价格阶梯边界处(99 张应报 31.68 欧元)连续 30/30 次报出 29.70(按上一档单价算),且中英文均如此——不是随机错误,而是稳定误读。更糟的是这类「安静错误」(审查者看不出来的错误)达每千条回复 250 次,而「响亮错误」为零。
准确率已无法区分模型:15 个模型中 10 个全对。最便宜的 Ling 3.0 Flash(0.000024 美元/条)236 条全对,而同样全对的 Claude Haiku 单条成本是它的 89 倍。
盲测写作评分(120 条、去除模型身份)发现唯一有区分度的维度是「是否展示计算过程」:GPT-5.6 Luna 和 Grok 4.3 都只给裸总价,无可核对的依据——而 Luna 正是他们据此轮结果选定的生产默认模型。作者也坦承两个削弱因素:展示过程与回复长度相关性 0.85,且盲评由 Claude 完成、Claude Haiku 也在被测之列。
他们还在自己评分器里发现一个 bug(价格中的「15」被误当候选数字),并指出 30 次生成买到的稳定性超预期:101/120 个单元格内 30 次结论一致,平均一致性 97%。
「模型」频道最新
- Claude Fable 5.1 高配版以 92.3% 刷新 WeirdML 评测 SOTA — teortaxesTex · 2026-09-03
- 分析称 OpenAI 若在 Astra 上用 Looped Transformer,必已验证可扩展 — teortaxesTex · 2026-09-03
- 企业宁多付数倍用 token 计费,数据保留担忧让 AI 订阅折扣失灵 — random_walker · 2026-09-03
- antirez:编码评测基准多是「垃圾」,与训练实际能力严重脱节 — antirez · 2026-09-03
- 阿里云联合 Hermes 办 200+ 人活动,展示 Qwen 3.8 全系模型 — Teknium · 2026-09-03
- Astra 在 ExploitBench 拿满分,官方自建变体重测漏洞利用能力 — inductionheads · 2026-09-03