Jev 模型走红,与 NUS 论文 ConfTuner 同押概率校准路线

机器之心 · wechat · 2026-10-04

TypeSafeAI 推出的 Jev 模型近期出圈:开发者输入状态与问题,模型直接返回预定义选项、分数或事件概率,可被代码直接调用,支持并行概率预测,并强调概率校准——让给出的概率反映真实正确率。目前 Jev 未开源,架构细节未公开。

其技术思路与 NeurIPS 2025 入选论文 ConfTuner 高度一致。新加坡国立大学团队提出的 Tokenized Brier Score 方法,从模型 logits 中取出 0–100 各候选置信度 token,对整组概率分布做 softmax 并直接训练:答案答错却高置信即受重罚。该损失被证明是 Proper Scoring Rule,训练只需对错标签,无需人工标注置信度。

实验上,在 HotpotQA 训练、跨 GSM8K 等五个数据集测试,LLaMA、Qwen、Ministral 的平均 ECE 分别从 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884;2000 条数据在 4 张 A40 上约 4 分钟完成微调,远快于 LACIE(26 分钟)与 SaySelf(120 分钟)。校准后的概率可用于模型级联:低置信度触发自我修正或路由更强模型,同预算下 HotpotQA、TruthfulQA 准确率最高提升 9.3% 和 5.5%。

团队还开源了延伸项目 JevTuner:为候选业务决策设单 token 槽位,直接读 logits 得到决策概率分布,用多分类 Brier Loss 训练,验证「决策 token」路线的可行性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →