JevBench v1.6.0 重测 92 个模型,榜首换血并新增 22 语言细分
JevBench 发布 v1.6.0,在全新密封测试集上从头重测全部 92 个 Jev 级模型,榜单头部明显变化:Quyet-1.0-Large 以 81.7 分登顶能力榜,超过 deck-31B 的 77 分。平台还新增按 22 种语言细分打分,早期信号显示 31B 级模型表现坚挺(deck-31B 德语 97 分、Quyet 94 分),而若干 4B 小模型多语种能力出现崩塌。
2026-10-05 ~ 2026-10-05 · 3 条相关
- JevBench v1.6.0 重测 92 个模型,榜首大换血 — airesearch12 · 2026-10-05
- JevBench 新增 22 语言细分,小模型多语种能力崩塌 — airesearch12 · 2026-10-05
另有 1 条近重复转述:airesearch12