JevBench 拆分榜单:开源模型与 API 服务商将分开排名
airesearch12 · x · 2026-10-07
JevBench 宣布即日起将开源权重模型与托管 API 服务商拆分为两个独立排行榜,理由是两者混排并非同类比较。
要点:
- 开源榜中仅保留原版 Jev 作为参照(不参与排名),因其为该类型的开创性模型
- 作者正在用最新方法重新测量所有 API 服务商,部分已更新
- 开源榜页面仍可通过开关查看 API 托管版本的成绩
- 开源榜与 API 榜链接均已附上
所属事件:JevBench 拆分榜单:开源模型与 API 服务商分开排名(2 条相关)→
「模型」频道最新
- 小米 MiMo-V2.6-Pro 登顶开源权重模型榜,发布 7000+ RL 环境 — DeepLearningAI · 2026-10-07
- 拉满推理档位成本近翻倍收益甚微:Opus 5.5 xhigh 约等于 Sonnet 5.5 max 半价 — randal_olson · 2026-10-07
- 用户质疑 ChatGPT Plus 每月 20 美元:是在付费买限速吗 — Gazialp · 2026-10-07
- 多图编辑竞技场上线:gpt-image-2.5 居首,44 模型逾 900 万票 — arena · 2026-10-07
- BDH-CQ 潜在推理登 ARC-AGI-1:29.5% 成绩,每任务仅 $0.0007 — bendee983 · 2026-10-07
- Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分 — marktenenholtz · 2026-10-07