Jev 实测:唯一亚秒级且会坦承不确定的校准门控模型

AlexKim · x · 2026-09-19

TypeSafe 发布的 Jev 返回带校准概率的结构化判断而非文本:Choice 从选项中选一、Score 按序级评分、Noul 输出 yes/no 条件成立的概率,无 prose、无推理轨迹。独立问题共用同一 state 在一次请求中并行执行,十二项检查只需一次调用、state 只计费一次。

作者用 150 段文本(来自 35 篇博客的两个版本,判断哪段出自改写版)对 16 个模型跑了 2400 次调用测 ECE(期望校准误差):

作者还开源了一个 Claude Code hook 用于运行该校准检查。

所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →