JevBench v1.4 上线:308 道封闭演化题防刷榜,已收录超 70 个模型
airesearch12 · x · 2026-09-23
JevBench 发布 v1.4 版本,收录模型超过 70 个,当前 Top 5 为 Jev、JevK5、Hopper、Winnow-12B Q8、reflex 4B。本次更新的核心是防刷榜(benchmaxxing)机制:
- 封闭演化测试集:新增 308 道持续演化的封闭难任务,占 Intelligence 总分的 20%,私有 held-out 集不断更新,防止公开集饱和与训练数据泄漏。
- 校准机制:校准分数按加权方式混入封闭集结果;k=1 惩罚项针对公开集与封闭集差距超过 25 个百分点的模型,奖励真正的泛化能力。
- 四轴等权调和平均:综合平衡四个维度。
- 速度与成本门槛:即使能力顶尖,若推理过慢或成本过高也会被降级。
- API 端点透明度:榜单新增 API 标记,显示哪些 API 端点接收过封闭测试题目文本,答案从不外泄。
所属事件:JevBench 更新 v1.4:收录超 70 模型并强化防刷榜(3 条相关)→
「模型」频道最新
- 开源 Audio8 ASR Infinite:超低延迟 24/7 无限流式语音转写 — TheMoonMidas · 2026-09-23
- 「智能会变便宜」?开发者吐槽 AI 账单不降反涨 — zeeg · 2026-09-23
- 曝腾讯混元 V4.1 将采用 HySparse2 架构,中国模型架构再掀波澜 — teortaxesTex · 2026-09-23
- 小米 MiMo 2.6 Pro 用 Lean 4 完整形式化「周期三蕴含混沌」定理 — Dr_Singularity · 2026-09-23
- 实测发现 Sonnet 拒答的问题切换到 Fable 后不拒绝 — davidmanheim · 2026-09-23
- 开源基准已被污染:模型会正则搜出「藏起来」的答案 — a1zhang · 2026-09-23