JevBench v1.6.0 重测 92 个模型,榜首大洗牌

airesearch12 · x · 2026-10-05

作者在全新密封测试集上从头重测了全部 92 个 Jev 级模型,榜单头部发生明显变化:能力榜新科第一为 Quyet-1.0-Large(81.7 分),超过 deck-31B(77.6)和 Jev 1.13.0(76.5)。

v1.6.0 是迄今最抗数据污染的版本:每次发布使用无人见过的新密封题集、托管 API 拿到从未发送给任何供应商的题目、题目在有限使用后退役,确保分数反映真实能力而非记忆的测试项。

所属事件:JevBench v1.6.0 重测 92 个模型,榜首换血并新增 22 语言细分(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →