同成本实测:Jev MMLU-Pro 82.9% 大幅领先通用模型 58.8%

simonguozirui · x · 2026-09-18

开发者 ekzhang1 做了一组同性能同成本下的对比实验:用 Qwen3.6-35B-A3B(非推理模式)搭建了 Jev 兼容的公开 API,仅靠 SGLang 的 radix cache 保留 prefill 复用,实现极快的并行 generation——64 个任务不到 1 秒完成。

对比结果:MMLU-Pro 上 Jev 82.9% vs OpenJev 58.8%,Jev 明显更聪明;BoolQ 校准测试显示 Jev 略偏过度自信,OpenJev 偏保守。结论是校准都还可接受,但 Jev 能力占优。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →