16 模型校准实测:Jev 快而诚实但准确率仅列第10
开发者 AlexKim 为判断 TypeSafe 的 Jev 是否值得加入自己的技术栈,对 16 个模型做了系统实测,重点比较 Jev 与 Haiku,并意外发现「校准」这一项几乎没打算测的指标反而最有区分度。
已确认
- Jev 准确率在 16 个模型中只排第 10;作者经历多轮结论修正:AI 生成的初稿结论相互矛盾,一说「Jev 置信度可用、Haiku 不行」,一说「Haiku 更准」,最终在正确统计和加测任务后才确定 Jev 与 Haiku 在关键校准指标上打平。
- 模糊区间(0.35–0.65)作答率方面:Sonnet 5 达 41.3%,Fable 5.1 为 36.7%,Jev 为 34.7%,Opus 5 为 23.3%,前四名之后断崖式下跌;开源模型几乎从不落在模糊区间,即几乎从不说「不确定」。
- Jev 是四个「诚实承认不确定」的模型中唯一亚秒级响应的:455 毫秒,为 16 个模型中最快;次快的诚实模型 Sonnet 5 需要 3.7 倍时间。作者认为这让 Jev 可承担全量请求的门控角色。
- 价格和发布时间均无法预测校准表现:最贵的 kimi-k3 在准确率和校准上双双垫底;deepseek-v4-flash 以 0.003 美元跑完全部测试,准确率反而超过 Jev。
- Jev 返回带校准概率的结构化判断而非文本:Choice 从选项中选一、Score 按序级评分、Noul 输出 yes/no 条件成立的概率,无 prose、无推理轨迹;独立问题共用同一 state 可在一次请求中处理。
为什么重要
- 作者强调:价格和「身价」都不决定模型是否会承认不确定,选型时应看实测校准数据而非价格标签。
- 一个任务构不成基准:作者以自身经历说明单任务结论(如「Haiku 更准」)会随加测任务而反转,评测结论必须在数据面前反复存活。
- 「快 + 诚实」的组合让 Jev 占据独特生态位:可作为低成本、低延迟的全量请求门控,与其他模型分工协作。
2026-09-19 ~ 2026-09-19 · 8 条相关
一手来源
- 16 模型校准实测:开源模型几乎从不说「不确定」 — AlexKim ·
- 为验证一个模型实测 16 家:一个任务构不成基准 — AlexKim ·
- Jev 实测:唯一亚秒级且会坦承不确定的校准门控模型 — AlexKim ·
- 实测16个模型:TypeSafe Jev 准确率仅排第10 — AlexKim · 2026-09-19
- 作者实测16个模型发现:关键校准指标上Jev与Haiku打平 — AlexKim · 2026-09-19
- 16模型评测另发现:Sonnet 5 模糊区间作答率高达41.3% — AlexKim · 2026-09-19
- 【源头】为验证一个模型实测 16 家:一个任务构不成基准 — AlexKim · 2026-09-19
- 【源头】16 模型校准实测:开源模型几乎从不说「不确定」 — AlexKim · 2026-09-19
- 校准实测续:最贵模型准确率和校准双双垫底 — AlexKim · 2026-09-19
- Jev:唯一又快又「诚实」的模型,455ms 可当全量门控 — AlexKim · 2026-09-19
- 【源头】Jev 实测:唯一亚秒级且会坦承不确定的校准门控模型 — AlexKim · 2026-09-19