Jev 模型走红,与 NUS 论文 ConfTuner 同押概率校准路线
机器之心 · wechat · 2026-10-04
TypeSafeAI 推出的 Jev 模型近期出圈:开发者输入状态与问题,模型直接返回预定义选项、分数或事件概率,可被代码直接调用,支持并行概率预测,并强调概率校准——让给出的概率反映真实正确率。目前 Jev 未开源,架构细节未公开。
其技术思路与 NeurIPS 2025 入选论文 ConfTuner 高度一致。新加坡国立大学团队提出的 Tokenized Brier Score 方法,从模型 logits 中取出 0–100 各候选置信度 token,对整组概率分布做 softmax 并直接训练:答案答错却高置信即受重罚。该损失被证明是 Proper Scoring Rule,训练只需对错标签,无需人工标注置信度。
实验上,在 HotpotQA 训练、跨 GSM8K 等五个数据集测试,LLaMA、Qwen、Ministral 的平均 ECE 分别从 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884;2000 条数据在 4 张 A40 上约 4 分钟完成微调,远快于 LACIE(26 分钟)与 SaySelf(120 分钟)。校准后的概率可用于模型级联:低置信度触发自我修正或路由更强模型,同预算下 HotpotQA、TruthfulQA 准确率最高提升 9.3% 和 5.5%。
团队还开源了延伸项目 JevTuner:为候选业务决策设单 token 槽位,直接读 logits 得到决策概率分布,用多分类 Brier Loss 训练,验证「决策 token」路线的可行性。
「模型」频道最新
- Claude Code 封号用户的补救路:装 Antigravity 免费用 Opus — AlchainHust · 2026-10-04
- Astra 自称无法确定自己是否有主观体验 — VoidStateKate · 2026-10-04
- Qwen3.8 Flash Next 激进优化,或为 Qwen4 快速铺路 — demomanca · 2026-10-04
- 马斯克团队晒 Grok Bot 实用案例,网友对比吐槽 ChatGPT Dot 假响铃 UI — elonmusk · 2026-10-04
- 「不是 X 而是 Y」:RLHF 式对冲话术正在污染人类表达 — sloppenheimer · 2026-10-04
- 前沿 AI 法律研究基准成绩已可比肩律师 — Sanity · 2026-10-04