小模型校准实测:Kev-9b 错题常自报九成把握

一项针对模型置信度校准的评测显示:Kev-9b 与 Decider-2b 在人工标注上准确率最高且响应仅 5ms,但在难题上大量错误答案自报 90% 置信度,其置信度声明必须全部作废;而 0.6B 的开源模型 Eve 勉强通过测试——1599 道题中 115 道达到 90% 置信,673 道错题中仅 12 道自称 90%,即它说「90% 确定」时基本可信。

2026-09-24 ~ 2026-09-24 · 2 条相关