JevBench 作者回应微软引用争议 解释双榜分设缘由
JevBench 作者就微软视频引用该基准引发的争议作出回应,解释为何将开源模型与 API 提供的决策模型分设两张排行榜,核心考量是公平性。JevBench 以「能力+速度+成本」的组合方式定义 Jev 分数。作者指出微软视频引用的实为开放模型排行榜而非 API 提供商榜单,并给出官方结果:Microsoft-Decision-1 在 API 决策模型榜中位列第 6。
2026-10-11 ~ 2026-10-11 · 2 条相关
- JevBench 官方榜单:Microsoft-Decision-1 居 API 决策模型第 6 — airesearch12 · 2026-10-11
- JevBench 作者解释:为何开源与 API 模型分设两张排行榜 — airesearch12 · 2026-10-11