JevBench v1.2 发布:Jev 1.13 以 75.3 分险守榜首
airesearch12 · x · 2026-09-19
JevBench v1.2 排行榜更新,Jev 1.13 以 75.3 分继续领先,开源 4B 模型 SemIf 以 74.6 分紧咬,另一开源模型 open-alternative-jev 得 69.8 分。
该基准的计分方式值得关注:智能、校准度(calibration)、速度、成本四项各占 25%,取几何平均——任何一轴太弱都会拖垮总分,「没有地方可以藏短板」。发布者称已两次复核结果。
「模型」频道最新
- GPT-6 Astra 破解一战德国无线电密文,HN 热议 — petrusenko_max · 2026-09-19
- 被 DeepSeek 4.1 Flash 惊到:手机授权场景主动生成二维码免复制 token — mariofilhoml · 2026-09-19
- 爆料:OpenAI Pro 20x 订阅对新用户停售已 9 天,算力吃紧 — haider1 · 2026-09-19
- 网友爆料 OpenAI 疑似新模型,出现蓝队红队配置 — lxfater · 2026-09-19
- 作者实测 287 个 Jev 开源项目,精选 20 个看清小模型真正用武之地 — chenrongwei · 2026-09-19
- Qwen3.8-Omni-Flash 定价低于 Gemini Flash,多模态基准几乎打平 — The Decoder · 2026-09-19