Kev-9b 与 Decider-2b 实测:错题常自报 90% 把握
colinmcnamara · x · 2026-09-24
校准评测线程结论:Kev-9b 与 Decider-2b 在人工标注上准确率最高、响应仅 5ms,但在难题上有大量错误答案自报 90% 置信度——答案可以采用,但置信度声明必须全部复核。同线程另测出 0.6B 开源模型 Eve 勉强通过:673 道错题中仅 12 道自称 90%,当它说 90% 时基本可信。
所属事件:小模型校准实测:Kev-9b 错题常自报九成把握(2 条相关)→
「编程与Agent」频道最新
- Ethan Mollick 用 Claude 多智能体复刻 1984 年老游戏 Rescue Raiders — emollick · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- 把 Jev 接进 Mythic:用大模型给红队命令的 OPSEC 强度打分 — dyn___ · 2026-09-24
- Ethan Mollick 用 Claude 多智能体协作复刻童年老游戏 Rescue Raiders — emollick · 2026-09-24
- YC CEO Garry Tan:用 Capy 后 PR 速度比裸用 Codex 快 4 倍以上 — garrytan · 2026-09-24
- Claude 用 Chrome 自动化烧 token 惊人,一行 CLAUDE.md 规则解决 — AIandDesign · 2026-09-24