五大前沿模型事实核查对比:23%结论严重相悖

Pavel___1__ · reddit · 2026-08-25

Lenz 研究团队将 1000 条真实事实核查 claim 输入 Claude Fable 5、GPT-5.6、Gemini 3.1 Pro、Sonar Deep Research 和 Grok 4.5 五个前沿模型(均开启联网与思考)。结果显示:五者完全一致的仅占 37%;23% 的情况下,模型间的结论在 5 级量表上相差 2 级以上(实质性分歧)。模型性格差异显著:Gemini 倾向于非黑即白,Sonar 频繁折中,Claude 最接近多数派。研究发现模型自述的置信度(Confidence)几乎无效,76% 的回答都给了 9-10 分的绝对自信,即便在它们互相争执的 claim 上也是如此。作者警告:单一模型的裁决受限于厂商特性,且置信度不可作为人工介入的信号,模型间的不一致性远强于自评不确定性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →