JevBench v1.2.16 更新:Winnow-12B 首次进入榜单第五
airesearch12 · x · 2026-09-22
- 自制基准 JevBench 发布 v1.2.16,Winnow-12B 新晋排名第五;前三名保持不变:Jev、SemIf、djev。
- 配套的 Benchmark Heaven 站点提供综合评分、编码/智能体/科学等多维排名,并支持按价格口径(输入/输出权重)、托管地区、数据保密政策等条件筛选模型与供应商。
「模型」频道最新
- 安全研究者算账:像前沿实验室那样测 ExploitBench 要烧 5930 万美元 API 费 — OwariDa · 2026-09-22
- 小米发布 Qwen 3.5 9B 蒸馏模型,用 MiMo 数据 SFT 并开源 RL 环境 — teortaxesTex · 2026-09-22
- The Information:OpenAI 内部已基本自动化实验模型训练流程,新模型解出 100 道悬置数学难题 — kimmonismus · 2026-09-22
- 实测 Grok 4.7 音乐错误检测满分,比肩 GPT-6 Astra — yunta_tsai · 2026-09-22
- MiMo-V2.6 被称最大开源 RL 单次训练,登顶开源模型 — andrew_n_carr · 2026-09-22
- 开发者吐槽 AI 编码最大痛点:模型还是太蠢、太慢、太贵 — remilouf · 2026-09-22