16模型评测另发现:Sonnet 5 模糊区间作答率高达41.3%

AlexKim · x · 2026-09-19

同一评测系列的后续发现:作者几乎没打算测的一项指标反而最有区分度——各模型把答案落在 0.35-0.65 模糊中间区的频率:

此后数据出现断崖式下跌,Opus 5 明显最少给模糊答案。

所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →