Jev 校准度实测落后 Gemini、DeepSeek,但独立决策占比仍最高
frappuccinoCoin · reddit · 2026-09-22
Jev Benchmarks 对 Jev 的置信度校准进行了测量,其训练方法名为「用于校准决策的强化学习」。与人类标注对比的校准差距(越低越好):Yes/No 判断 Jev 5.0 vs Gemini 3.8 Flash 2.0;选择题 Jev 9.8 vs DeepSeek V4.1 Flash 2.8;评分标准类 Jev 19.7 vs GLM-5.3 12.9。
尽管校准更差,Jev 在保持 95% 准确率的同时,仍比上述模型能独立处理更多决策(86% 的 Yes/No 判断),即更擅长「知道自己什么时候是对的」。
「模型」频道最新
- Vals AI 评测:Grok 4.7 综合分不升反降,跌至第 24 名 — zacharynado · 2026-09-22
- Grok 4.7 第二例:分析三年财报,识破汇率掩盖的增长真相 — ArtificialAnlys · 2026-09-22
- Grok 4.7 实测案例:能独立跑估值链并质疑交易伙伴的估算 — ArtificialAnlys · 2026-09-22
- Artificial Analysis 实测 Grok 4.7:仅次于 Anthropic,成本约 Opus 5 一半 — ArtificialAnlys · 2026-09-22
- 安全研究者算账:像前沿实验室那样测 ExploitBench 要烧 5930 万美元 API 费 — OwariDa · 2026-09-22
- 小米发布 Qwen 3.5 9B 蒸馏模型,用 MiMo 数据 SFT 并开源 RL 环境 — teortaxesTex · 2026-09-22