Jev 校准度实测落后 Gemini、DeepSeek,但独立决策占比仍最高

frappuccinoCoin · reddit · 2026-09-22

Jev Benchmarks 对 Jev 的置信度校准进行了测量,其训练方法名为「用于校准决策的强化学习」。与人类标注对比的校准差距(越低越好):Yes/No 判断 Jev 5.0 vs Gemini 3.8 Flash 2.0;选择题 Jev 9.8 vs DeepSeek V4.1 Flash 2.8;评分标准类 Jev 19.7 vs GLM-5.3 12.9。

尽管校准更差,Jev 在保持 95% 准确率的同时,仍比上述模型能独立处理更多决策(86% 的 Yes/No 判断),即更擅长「知道自己什么时候是对的」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →