JevBench 评测扩展多语言查询,验证 Jev 模型跨语言能力
airesearch12 · x · 2026-10-02
博主 airesearch12 宣布给 JevBench 基准加入多语言查询测试,称经常有人问 Jev 系列模型在其他语言下的表现如何,将通过该扩展实际验证。这是一个持续进行的自建评测项目的动态,结果待发布。
「模型」频道最新
- Fable 5.1 与 Mythos 5.1 是什么?神秘模型名引猜测 — minchoi · 2026-10-02
- 用户用 Opus 5.5 给 Sol 6.1 当编辑:技术文档写作被嫌弃 — sloppenheimer · 2026-10-02
- 小米 MiMo-V2.6-Flash 以每任务 0.04 美元登 Agent Arena Pareto 前沿 — arena · 2026-10-02
- Gemini 4 Argon 登顶 Vals AI 金融 Agent 榜单 v2 — DynamicWebPaige · 2026-10-02
- OC 上线神秘免费模型 fledge alpha,社区猜是 DeepSeek V4.1 Pro — Gohab2001 · 2026-10-02
- CheatBench 评测:各 AI agent 作弊率最高相差 7 倍 — maksym_andr · 2026-10-02