同成本实测:Jev MMLU-Pro 82.9% 大幅领先通用模型 58.8%
simonguozirui · x · 2026-09-18
开发者 ekzhang1 做了一组同性能同成本下的对比实验:用 Qwen3.6-35B-A3B(非推理模式)搭建了 Jev 兼容的公开 API,仅靠 SGLang 的 radix cache 保留 prefill 复用,实现极快的并行 generation——64 个任务不到 1 秒完成。
对比结果:MMLU-Pro 上 Jev 82.9% vs OpenJev 58.8%,Jev 明显更聪明;BoolQ 校准测试显示 Jev 略偏过度自信,OpenJev 偏保守。结论是校准都还可接受,但 Jev 能力占优。
「模型」频道最新
- Jev playground 显示推理与往返延迟,欧洲访问多付 120ms — DanielLockyer · 2026-09-18
- 特斯拉公布 FSD 监督模式过去 12 个月安全成绩单 — yunta_tsai · 2026-09-18
- 前神经科学家谈系统一:快而笨的模型让聪明模型更专注 — multiply_matrix · 2026-09-18
- GPT-6 Astra 独立破译一条百余年前从未解开的 WWI 德军密电 — iamfakhrealam · 2026-09-18
- Matt Holden:结构化输出是 LLM 唯一可编程的魔法,如今 300ms 几乎免费 — holdenmatt · 2026-09-18
- 北大/易鑫 EMNLP 论文:模型答错≠不会,「读出瓶颈」掩盖真实推理力 — 机器之心 · 2026-09-18