JevBench 改用 Capability Score 计分,原版 Jev 重返榜首
airesearch12 · x · 2026-10-02
第三方 LLM 基准 JevBench 发布 v1.5.4,将头条分数从 Composite Score 改为 Capability Score。作者解释原因:速度和成本太容易受假设影响、被人为操纵,容易让慢模型钻空子,因此只按能力计分。
改版后榜首为 Original Jev,Winnow、Cygnet、Surogate Rune 依次排在其后。Benchmark Heaven 平台还提供价格口径(输入/输出权重比)、EU/中国/美国托管与公司属地、数据保密策略等多维筛选。
「模型」频道最新
- JevBench 将扩充评测:LLM 路由、RAG 检索与内容审核任务 incoming — airesearch12 · 2026-10-02
- 曝谷歌内部模型 Argon:20 万员工日常实测 — Zergylord · 2026-10-02
- 号称欧盟首个系统一模型 JEV 上线,主打欧洲本地托管 — juanviera23 · 2026-10-02
- Gemini 莫名说出用户母亲真名,被追问后三次改口解释 — Exact_Firefighter864 · 2026-10-02
- GPT-6.1 Sol 以四分之一价格逼近 Astra,成本性价比飞速提升 — danielmckinn0n · 2026-10-02
- PostTrainBench v1.2 出新结果,后训练能力榜更新 — mariofilhoml · 2026-10-02