预注册实测 Jev「不幻觉」声明:类型安全零违规,置信度校准数据集间分裂
NervousAd4440 · reddit · 2026-09-21
ASSAY-001 项目在获取 API 前冻结协议,对 Jev 的「can't hallucinate」声明做了预注册测试:两个公开语料、单次运行无重试、第三方盲评。
- 类型安全成立:8,576 条响应(Banking77 + CLINC150)零 schema 外输出。
- 校准依赖数据集:CLINC150 的 ECE 0.0204 通过;Banking77 ECE 0.0936 不通过,低置信区间系统性过度自信——schema 合法的答案仍可能错,且置信分没有预警,常用阈值门控(>0.9 执行、0.5-0.9 确认、以下升级)需按自己的标注数据拟合。
- 两项独立评测均失利:Claude Haiku 4.5 在 2,000 封邮件钓鱼分类上胜过 Jev;Jev 单用在 9,831 对重排上不敌 bge-m3,需融合才赢。
作者另推荐了含失败评测条目的 awesome-jev 仓库,并询问哪些标签集影响其校准。
「模型」频道最新
- Jev 被指与 8 个月前论文 autorubric 评测抽象几乎一一对应 — deliprao · 2026-09-21
- Ethan Mollick:长程 Agent 任务最烦的不是幻觉,而是语言越写越漂 — emollick · 2026-09-21
- Laya 并非仅支持 512 上下文:实为 ModernBERT,配置上限 8192 — antoine_chaffin · 2026-09-21
- 投石机比喻解析 AI 模型的锯齿状能力与机器人部署鸿沟 — lateinteraction · 2026-09-21
- API 级前沿模型五大错误模式:静默幻觉与无告警失败 — gerardsans · 2026-09-21
- Qwen Image 2.1 许可证遭吐槽:用户怒称「最差许可」 — switch2stock · 2026-09-21