JevBench v1.4 补充链接帖:防刷榜机制详情见原推
airesearch12 · x · 2026-09-23
作者转发补充一个链接,指向 JevBench v1.4 的方法说明。核心内容与上一条相同:新增 308 道持续演化的封闭任务(占 Intelligence 分 20%)、k=1 惩罚公开集与封闭集超 25 个百分点的差距、四轴等权调和平均、速度与成本门槛,以及标记接收过封闭题的 API 端点。
所属事件:JevBench 更新 v1.4:收录超 70 模型并强化防刷榜(3 条相关)→
「模型」频道最新
- 研究者实测:opus 5.5 或为 4.5 后最强,但 sol 5.6 综合仍居首 — DimitrisPapail · 2026-09-23
- 开发者实测 Opus 5.5 表现出色,但年度全能模型仍是 5.6-sol — DimitrisPapail · 2026-09-23
- Angaisb_:99% 评测零提升甚至倒退时,别拿「自己试试」当借口 — Angaisb_ · 2026-09-23
- Gemini 3.8 Flash TTS 定价$32.98/百万字符,较上代反而更贵 — ArtificialAnlys · 2026-09-23
- 214 次 API 调用实测 Ling-3.0-flash-VL:小票核账抓出 30 元差错 — alifcoder · 2026-09-23
- 开源 Audio8 ASR Infinite:超低延迟 24/7 无限流式语音转写 — TheMoonMidas · 2026-09-23