JevBench 更新至 v1.5.5:能力榜前十不变,Jev 仅列综合第三
airesearch12 · x · 2026-10-02
Benchmark Heaven 的 JevBench 更新至 v1.5.5:能力分前十名无变化,Jev 仍居第一,但 Winnow、Cygnet、Surogate Rune 等开源竞争者已紧咬不放;综合分上 Jev 仅列第三。新版本增加了雷达图,按 Jev 典型用例对比各模型能力分布。
配套站点 Benchmark Heaven 提供丰富的筛选维度:按托管地区(中国/欧盟/美国及公司注册地)、数据保密政策(是否用你的数据训练)、多种价格口径(不同输入输出比的调整成本)、仅开源权重模型等,帮助用户按用例选模型。
所属事件:JevBench 改用能力分计分并支持自定义成本边界(3 条相关)→
「模型」频道最新
- llama.cpp 新增 Decision Models,本地推理迎来新玩法 — paf1138 · 2026-10-02
- 开发者试新模型 Argon:按 GPT 外部用法信任它跑,未见刷榜痕迹 — cgarciae88 · 2026-10-02
- NVIDIA 发布 Kumo-Tabular:面向结构化数据的表格基础模型 — nvidia · 2026-10-02
- Runware 上线 Claude Sonnet 5.5、Grok 4.7、GPT-6.1 Sol 三个新模型 — aziz4ai · 2026-10-02
- Gemini 4 Argon 限供网络防御者,被指是责任控制而非利他 — TansuYegen · 2026-10-02
- 用户实测 GPT-6.1 自动整理数十笔 AI 订阅账单,仅耗 2% 额度 — EXM7777 · 2026-10-02