JevBench v1.6.0 重测 92 个模型,榜首换血并新增 22 语言细分

JevBench 发布 v1.6.0,在全新密封测试集上从头重测全部 92 个 Jev 级模型,榜单头部明显变化:Quyet-1.0-Large 以 81.7 分登顶能力榜,超过 deck-31B 的 77 分。平台还新增按 22 种语言细分打分,早期信号显示 31B 级模型表现坚挺(deck-31B 德语 97 分、Quyet 94 分),而若干 4B 小模型多语种能力出现崩塌。

2026-10-05 ~ 2026-10-05 · 3 条相关

另有 1 条近重复转述:airesearch12