五大前沿模型事实核查对比:23%结论严重相悖
Pavel___1__ · reddit · 2026-08-25
Lenz 研究团队将 1000 条真实事实核查 claim 输入 Claude Fable 5、GPT-5.6、Gemini 3.1 Pro、Sonar Deep Research 和 Grok 4.5 五个前沿模型(均开启联网与思考)。结果显示:五者完全一致的仅占 37%;23% 的情况下,模型间的结论在 5 级量表上相差 2 级以上(实质性分歧)。模型性格差异显著:Gemini 倾向于非黑即白,Sonar 频繁折中,Claude 最接近多数派。研究发现模型自述的置信度(Confidence)几乎无效,76% 的回答都给了 9-10 分的绝对自信,即便在它们互相争执的 claim 上也是如此。作者警告:单一模型的裁决受限于厂商特性,且置信度不可作为人工介入的信号,模型间的不一致性远强于自评不确定性。
「模型」频道最新
- 千条提问实测:ChatGPT 与 Google AI 引用重合率仅 2.6% — nikvassev · 2026-08-25
- 传阿里 Qwen 即将发布 125B 总参 6B 激活新模型,社区欢呼「120B 时代」到来 — TheZachMueller · 2026-08-25
- Unsloth AI 将首日支持 Qwen 模型接入 llama.cpp — danielhanchen · 2026-08-25
- MiniMax 上线 H3 模型与 Design 端到端创作平台 — mhdfaran · 2026-08-25
- Qwen 官宣:Qwen3.8-Flash-Next 即将开源 — cedric_chee · 2026-08-25
- AI 检测工具指认某内容疑似由 Claude 生成 — pedrodias · 2026-08-25