JevBench v1.4.1 评分门控:智能分低于 50 触发降级,分差达 27.5
airesearch12 · x · 2026-09-24
JevBench 发布 v1.4.1 版本中的「Decision 2B」评分规则演示:与 Jev 1.13.0 对比,两模型在 Calibration(74.1 vs 76.3)、Speed(84.3 vs 83.3)、Cost(62.5 vs 52.0)三项上接近,但第四项 Intelligence 为 38.8 vs 53.1——低于 50 的门槛触发门控(gate),最终综合分 35.80(第 25 名)vs 63.29(第 1 名)。
这说明 JevBench 不是简单加权平均,而是设置硬性能力门槛:某项核心能力不达标即大幅压低总评分,防止弱模型靠低价或速度刷排名。
所属事件:JevBench v1.4.1 榜单更新:新增六系统前五不变(3 条相关)→
「模型」频道最新
- Anthropic 新模型 token 效率大幅提升,任务精度与消耗比更优 — auto_grad_ · 2026-09-24
- GPT-6 系列丢掉了 GPT-5.6 死磕任务到完成的特性 — jdjohnson · 2026-09-24
- philschmid 提及 Gemini 3.8 Flash,建议多模态理解任务就用 Gemini — _philschmid · 2026-09-24
- FLock THIS/THAT 1.2 单次前向决策模型发布,跑分超 Opus 与 GPT — matlabulous · 2026-09-24
- 用户抱怨 Claude 过度过滤:合法虚构内容也拒绝,比 ChatGPT 严苛得多 — Dogbold · 2026-09-24
- Fable 新行为:收到第二个提示时会中断自己先答新问题 — gleech · 2026-09-24