JevBench 改用 Capability Score 计分,原版 Jev 重返榜首

airesearch12 · x · 2026-10-02

第三方 LLM 基准 JevBench 发布 v1.5.4,将头条分数从 Composite Score 改为 Capability Score。作者解释原因:速度和成本太容易受假设影响、被人为操纵,容易让慢模型钻空子,因此只按能力计分。

改版后榜首为 Original Jev,Winnow、Cygnet、Surogate Rune 依次排在其后。Benchmark Heaven 平台还提供价格口径(输入/输出权重比)、EU/中国/美国托管与公司属地、数据保密策略等多维筛选。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →