Jev 实测:唯一亚秒级且会坦承不确定的校准门控模型
AlexKim · x · 2026-09-19
TypeSafe 发布的 Jev 返回带校准概率的结构化判断而非文本:Choice 从选项中选一、Score 按序级评分、Noul 输出 yes/no 条件成立的概率,无 prose、无推理轨迹。独立问题共用同一 state 在一次请求中并行执行,十二项检查只需一次调用、state 只计费一次。
作者用 150 段文本(来自 35 篇博客的两个版本,判断哪段出自改写版)对 16 个模型跑了 2400 次调用测 ECE(期望校准误差):
- 亚秒级「便宜门控」档位中,Jev 校准最好,且是唯一可靠承认不确定性的模型
- 全部 16 个模型中只有 4 个会承认不确定,Jev 是其中唯一亚秒级
- Jev 响应 455ms,全场最快;第二快承认不确定的是 Sonnet 5(慢 3.7 倍)
- 作者结论:除非代码要基于这个数值分支,否则 Jev 和 Haiku 没区别;它的定位是「可以随处跑的低成本校准门控」
作者还开源了一个 Claude Code hook 用于运行该校准检查。
所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→
「编程与Agent」频道最新
- Muse 接入 Plaid 自动记账,Robinhood 流水直写预算表 — alexandr_wang · 2026-09-19
- 开源引擎 Inco Splash 让 Qwen3.8-27B 在 M5 Max 跑出 144 tok/s — ResearchCrafty1804 · 2026-09-19
- Jev 准确率超越 Sonnet 5 检索方案,成本与延迟仅零头 — IanArawjo · 2026-09-19
- Jev 类 System 1 模型在实时语音 Agent 中的 9 个用法 — TheMoonMidas · 2026-09-19
- Grok Bots 支持 Webhooks,可在任意平台远程触发 — mattyp · 2026-09-19
- macOS 27 竟内置 mlx_whisper,Agent 可自动转写视频文稿 — vista8 · 2026-09-19