JevBench 作者解释:4B 模型登顶靠速度成本而非智能
airesearch12 · x · 2026-09-25
针对 decider-4b v2 登顶 JevBench 的疑问,作者解释:4B 小模型并非更聪明,Jev 在智能(53.1 vs 49.4)与校准度上仍领先;decider-4b 靠 5 倍速度与约一半价格取胜,因 JevBench 对智能、校准、速度、成本四项等权计分。需要原始智能可按 intelligence 排序。
所属事件:4B 开源模型登顶 JevBench:靠速度与成本取胜(3 条相关)→
「模型」频道最新
- Vending-Bench 实测:AI 模型经营一年,GPT-6 赚到 14,428 美元 — 141_1337 · 2026-09-25
- Kevin Roose 给 AI 智能体 $100 和 Kalshi 账户实测交易能力 — MickeySteamboat · 2026-09-25
- 前 Meta 工程师实测 Jev:与 GPT-nano 成绩相同,快 5 倍但贵 20% — danielmckinn0n · 2026-09-25
- Altimeter 创始人:OpenAI 解 Navier-Stokes 模型因审查未公开发布 — rohanpaul_ai · 2026-09-25
- GPT-6 Sol 上架 MathArena,成绩紧咬 GPT-6 Astra 但成本更低 — sandersted · 2026-09-25
- NeurIPS 2026 论文解释 Pass@k 优化为何损害 Pass@1:提示词干扰致梯度冲突 — lateinteraction · 2026-09-25