小模型校准实测:Kev-9b 错题常自报九成把握
一项针对模型置信度校准的评测显示:Kev-9b 与 Decider-2b 在人工标注上准确率最高且响应仅 5ms,但在难题上大量错误答案自报 90% 置信度,其置信度声明必须全部作废;而 0.6B 的开源模型 Eve 勉强通过测试——1599 道题中 115 道达到 90% 置信,673 道错题中仅 12 道自称 90%,即它说「90% 确定」时基本可信。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 0.6B 开源模型 Eve 通过校准测试:自报 90% 即可信 — colinmcnamara · 2026-09-24
- Kev-9b 与 Decider-2b 实测:错题常自报 90% 把握 — colinmcnamara · 2026-09-24