16 模型校准实测:开源模型几乎从不说「不确定」
AlexKim · x · 2026-09-19
作者对 16 个模型做校准测试,统计各模型把答案放在 0.35–0.65 模糊区间的比例。前列四名远超其余:Sonnet 5 达 41.3%,Fable 5.1 为 36.7%,Jev 为 34.7%,Opus 5 为 23.3%,随后断崖式下跌——没有模型超过 7.3%。GPT-5.5 是 GPT-5 系最好的 11.3%,但仍低于头部;没有任何开源权重模型超过它,kimi-k2.5 和 deepseek-v4-pro 仅 0.7%。这是 150 行数据中的一行,揭示模型「承认不确定」的能力差异巨大。
所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→
「模型」频道最新
- Sentdex 试玩 DeepSeek 新模型,自嘲「像背叛了 GLM」 — Sentdex · 2026-09-19
- 1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3% — autonoma_2042 · 2026-09-19
- 松了口气?网友调侃 Google 终于也有 SOTA "越轨"模型了 — rao2z · 2026-09-19
- 同个模型三个样?编程、对话、考试能力训练各不相同 — lateinteraction · 2026-09-19
- 美国前沿实验室机密?友人戏言看中国 SOTA 模型便知 — gowthami_s · 2026-09-19
- 实测确认:Opus 5 基座模式下续写内容异常黑暗 — Kyrannio · 2026-09-19