16 模型校准实测:开源模型几乎从不说「不确定」

AlexKim · x · 2026-09-19

作者对 16 个模型做校准测试,统计各模型把答案放在 0.35–0.65 模糊区间的比例。前列四名远超其余:Sonnet 5 达 41.3%,Fable 5.1 为 36.7%,Jev 为 34.7%,Opus 5 为 23.3%,随后断崖式下跌——没有模型超过 7.3%。GPT-5.5 是 GPT-5 系最好的 11.3%,但仍低于头部;没有任何开源权重模型超过它,kimi-k2.5 和 deepseek-v4-pro 仅 0.7%。这是 150 行数据中的一行,揭示模型「承认不确定」的能力差异巨大。

所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →