JevBench v1.5 发布:Cygnet 与 Winnow-12B 并列登顶,无单一第一
airesearch12 · x · 2026-09-29
Benchmark Heaven 的 JevBench v1.5 更新发布,首次出现无明确单一榜首的局面:Cygnet 和 Winnow-12B 综合得分几乎持平,并列第一;初代霸榜的 "Jev" 模型此次滑落至第三名。
本次版本还引入了多项方法论改进:榜单支持按价格基准(固定 I/O 配比、仅输出价格等)、任务负载、地区(托管地/公司注册地)、数据保密政策等维度过滤模型,并可将 Benchmaxxing 信号纳入综合评分。榜单覆盖编码 agent、全栈 Elo、Epoch ECI 等多个子项,可对比 coding、agentic、science 等能力。
所属事件:JevBench v1.5 发布:Cygnet 与 Winnow-12B 并列榜首(2 条相关)→
「模型」频道最新
- Databricks 实测:Opus 5.5 降本 20%,GPT-6 Luna 便宜 20 倍 — pwendell · 2026-09-29
- Anthropic Sonnet 5.5 登顶评测,反超 GPT-6 Astra 3 分 — haider1 · 2026-09-29
- 曝 Sonnet 5.5 修 Claude Code bug:速度提升 30%,用量省 30% — Justin_Halford_ · 2026-09-29
- Hesamation:AA 智能指数前五最聪明模型中四席被 Claude 包揽 — Hesamation · 2026-09-29
- Sonnet 5.5 上线 Claude Code,Pro/Max/Team 用户额度可重置 — ClaudeDevs · 2026-09-29
- Sonnet 5.5 引入 preserved thinking,封堵换账号蒸馏攻击 — ClaudeDevs · 2026-09-29