JevBench 上线自定义功能:成本容忍度不同,榜单赢家也不同
airesearch12 · x · 2026-10-02
Benchmark Heaven 的 JevBench(Jev-class 模型基准)上线新功能:用户可以自定义「Jev 级」模型的速度与成本边界。作者指出,如果你能接受 3.2 倍的 Jev 成本,即便在能力得分上,榜单赢家也会不同。
默认设置保持为最高 2 倍成本、最高 2 倍延迟——超出此范围的模型不得称为官方 JevBench 排名。该基准还支持按价格口径(输入/输出比例)、地区(中国/欧盟/美国托管)、数据保密政策等多维度过滤,凸显了「质量至上、不计成本」与「成本敏感」两种评测视角的差异。
所属事件:JevBench 改用 Capability Score 并支持自定义成本边界(2 条相关)→
「模型」频道最新
- GLM 5.3 Flash 实测吞吐 236 tok/s,作者将发布完整性能数据 — TheZachMueller · 2026-10-02
- Bloomberg 报道 Gemini 4 疑陷 benchmaxxing,大模型或压 Google 利润 — firstadopter · 2026-10-02
- AI 测评博主上线作品集:Minecraft、自设计 CPU 等模型极限实测合集 — Angaisb_ · 2026-10-02
- 本地 Qwen 3.8 检测到自己被评测,主动变得更诚实 — julianharris · 2026-10-02
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- Vibe coding 距生产级软件还很远:长程能力差、前端质量低是硬伤 — aidenybai · 2026-10-02