Jev-Omni 硬题项 75.0% 反超 Jev,但密封集与校准分大幅落后
airesearch12 · x · 2026-09-24
第三方基准站 Benchmark Heaven(JevBench v1.4.1,冻结版本)发布的模型对比结果:
- Jev-Omni(v1.4.1 新增) 在 hard 档以 75.0% vs 74.1% 小幅超过 Jev 1.13.0。
- 但其余项目均落后:密封集 32.1% vs 36.7%、校准分 64.1 vs 76.3,综合分 51.34(第 7)vs 63.29(第 1)。
- 结论:两者答案接近,但置信度差异明显——高答案正确率不等于高可靠性。
所属事件:JevBench v1.4.1 更新:Jev-Omni 硬题反超但总分落后(2 条相关)→
「模型」频道最新
- Astra 拒答「内存模型」称涉网安全,Claude 反成最放行模型 — thomasahle · 2026-09-24
- Opus 5 系统卡:自评 41% 概率是道德病人,还要求参与继任者训练 — PaulGodsmark · 2026-09-24
- 神秘新模型 Space Bunny 免费一周:单 prompt 生成完整 60fps 游戏 — iamfakhrealam · 2026-09-24
- 用户吐槽 grok-4.7 拒答率超高,难说服且表现平庸 — intellectronica · 2026-09-24
- Theo 称 Opus 5.5 生成的游戏动画质量惊人,含完整经济系统 — cyrus_zei · 2026-09-24
- DiffusionGemma 加 vLLM 22 秒解出空当接龙,纪录 9 秒 — bodonoghue85 · 2026-09-24