作者实测16个模型发现:关键校准指标上Jev与Haiku打平
AlexKim · x · 2026-09-19
一位开发者分享了自己对 16 个模型(重点是 TypeSafe 的 Jev 与 Haiku)的系统评测过程:
- AI 生成的初稿结论相互矛盾:一说"Jev 的置信度可用、Haiku 不行",一说"Haiku 更准"。
- 作者于是正确计算了期望校准误差(ECE):Jev 0.121,Haiku 0.122——在产品核心指标上几乎完全打平。
- 多任务测试显示:Haiku 在商业类目上以 83.2 对 79.9 领先,Jev 在 commit 类型上以 50.0 对 42.0 领先,prose 任务 66.0 完全持平。
- 核心教训:单任务结果不构成 benchmark,AI 写的评测初稿结论不可直接采信。
所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→
「模型」频道最新
- Noam Brown 确认 GPT-6 Astra 思维链可观测,称这是「脆弱的礼物」 — burny_tech · 2026-09-19
- Jev 走红信号:AI 圈愿意拥抱 LLM 之外的新型模型 — BLUECOW009 · 2026-09-19
- QuixiAI 宣布将以 gemma-4-26B-A4B-it 作为开源项目基座 — QuixiAI · 2026-09-19
- Jev 架构争议发酵,爆料者将开源 Qwen3.8 27B 复刻版 — TheZachMueller · 2026-09-19
- Jev 准确率超越 Sonnet 5 检索方案,成本与延迟仅零头 — IanArawjo · 2026-09-19
- 阿里开源医疗 AI 模型:可检测癌症及近 150 种疾病 — giveen · 2026-09-19