JevBench v1.3.0 发布:原版 Jev 以 74.4 分仍居首,47 个竞品逼近
airesearch12 · x · 2026-09-22
JevBench 更新至 v1.3.0。原版 Jev 仍以 74.4 分排名第一,但榜单已扩充到 47 个竞争模型,部分竞品分数已非常接近。榜单托管在 Benchmark Heaven,支持按价格口径(输入/输出混合比)、区域托管、数据保密政策等维度筛选与对比模型。
「模型」频道最新
- JevBench v1.3.0 上线:原版 Jev 以 74.4 领跑,47 个竞争者逼近 — airesearch12 · 2026-09-22
- Grok 4.7 Fast 被曝同模型双倍计价,仅限 Cursor 等渠道 — Daniel_Farinax · 2026-09-22
- async 4 罕见公开训练数据配比,评论者称 30 步全跑完表现意外 — stochasticchasm · 2026-09-22
- Grok 4.7 传已发布:为 Grok Bot 训练的全任务智能体模型 — elonmusk · 2026-09-22
- 质疑 OpenAI 数学评测口径:解决 100 难题却不说尝试了多少道 — burny_tech · 2026-09-22
- Matthew Berman 实测 Grok 4.7:直呼不知该作何感受 — Matthew Berman · 2026-09-22