JevBench 新增 22 语言细分,小模型多语种能力崩塌
airesearch12 · x · 2026-10-05
JevBench 现在将每个模型细分为 22 种语言分别打分。早期信号显示:31B 级模型表现坚挺(deck-31B 德语 97 分、Quyet 94 分),而若干 4B 小模型在日语或丹麦语上降至随机猜测水平。
如果用户不只用英语,选型前应查这张语言细分表。
所属事件:JevBench v1.6.0 重测 92 个模型,榜首换血并新增 22 语言细分(3 条相关)→
「模型」频道最新
- 研究者:人类也很难察觉 AI 的细微模式与分布偏差 — alexisjross · 2026-10-06
- 20美元档三家AI订阅横评:OpenAI最慷慨,Google暗降模型 — bytebot · 2026-10-06
- ChatGPT 伪造《纽约客》漫画还盗用真漫画家签名 — luisdans · 2026-10-06
- 网友预测 Thinking Machines 新模型 fledge alpha 将以 fledgling 之名发布 — willcb · 2026-10-06
- 圈内预言:GPT-6.5 或在 4 周内发布,性能对标 Fable 5.5 — VraserX · 2026-10-06
- Gemini 图像生成额度收紧引用户抱怨,日限成讨论焦点 — BrattyMiku · 2026-10-06