150 类意图实测 Jev:置信度校准出色(ECE 0.025),但 fallback 桶不可信
Artistic-Blood7501 · reddit · 2026-09-21
作者自费在 CLINC150 全量测试集(4,500 条域内 + 1,000 条域外)上评测了 TypeSafe 的 Jev(jev-1.13.0),检验其置信度是否有意义、显式「都不属于」选项能否兜住离题输入。151 个选项、零调优,5,500 条请求零错误。
结果
- 151 类准确率 89.4%(域内 90.6%);域外召回 83.8%、精确率 89.2%
- 置信度校准极佳:ECE 0.025,0.6 以上各箱实际正确率与声称值差 2-3 点内,96.2% 的高置信(0.9-1.0)答案正确
- 笔记本 16 并发下 p50 约 1.1 秒;1500 万输入 token 仅花 $0.63
关键坑:fallback 不可全信
- 162 条漏出 OUTOFSCOPE 的域外输入中,54 条以 ≥0.9 的置信度被分到具体意图(TIME 17 条、DEFINITION 15 条、DATE 11 条)——模式匹配的泛化问题置信度挡不住
升级人工的阈值表:置信度 <0.7 转人工拦截 48% 错误(整体准确率 93.7%);<0.9 转人工拦截 73%(96.2%)。
结果与此前 ASSAY-001 预注册测试的 CLINC150 数据(ECE 0.0204)吻合。完整表格、命令、逐条 JSONL 见 github.com/chr-kelly/jev-cookbook。
「模型」频道最新
- 实测 exllamav3 3bpw 跑 Flash:单张 5090 达 1500 prefill/29 tps — youcloudsofdoom · 2026-09-21
- ChatGPT 数月来反复读不了上传的 Excel,用户被迫靠截图绕过 — real4money · 2026-09-21
- Vals 用真实工作场景做私有评测,营收涨 8 倍 — TansuYegen · 2026-09-21
- Ethan Mollick:长程 Agent 任务最烦的不是幻觉,而是语言越写越漂 — emollick · 2026-09-21
- Laya 并非仅支持 512 上下文:实为 ModernBERT,配置上限 8192 — antoine_chaffin · 2026-09-21
- 投石机比喻解析 AI 模型的锯齿状能力与机器人部署鸿沟 — lateinteraction · 2026-09-21