Kev-9b 与 Decider-2b 实测:错题常自报 90% 把握

colinmcnamara · x · 2026-09-24

校准评测线程结论:Kev-9b 与 Decider-2b 在人工标注上准确率最高、响应仅 5ms,但在难题上有大量错误答案自报 90% 置信度——答案可以采用,但置信度声明必须全部复核。同线程另测出 0.6B 开源模型 Eve 勉强通过:673 道错题中仅 12 道自称 90%,当它说 90% 时基本可信。

所属事件:小模型校准实测:Kev-9b 错题常自报九成把握(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →