DecideBench 评测开源决策模型:Imajev-4B 达 95% 仍不敌 Jev
choyiny · reddit · 2026-09-30
作者 choyiny 用生产级数据集对多款开源 "typed decision" 模型做评测(DecideBench),结论是目前没有开源模型能击败 Jev,但差距不大且部分更具性价比。
主要发现
- Imajev-4B:95% 准确率,是超过 90% 门槛中最便宜的模型
- Tev(Together AI):92.8%
- Decider-4B 与 JevK5:均 >88%,价格和延迟更低,值得一试
- Kev4B、Laya、CLM、Julia-1 等在作者的类生产数据集上仍表现挣扎
作者征集更多 Jev 类模型加入评测。
「模型」频道最新
- 为 Astra 的「谨慎」辩护:会停下来提问的 Agent 才好用 — brandon_galang · 2026-10-01
- 用户吐槽:Opus 5.5用三天烧掉八成额度,弃用 — MaziyarPanahi · 2026-10-01
- Liquid AI 发布 LongevityBench:小型 LFM 在多项衰老任务胜过前沿模型 — JosephJacks_ · 2026-10-01
- GPT-6.1 Sol 实测:高效但偏慢,订阅方案变化引担忧 — kimmonismus · 2026-09-30
- GPT 6.1 Astra 超代码模式生成 three.js 海洋场景 — OpenAIDevs · 2026-09-30
- 分析称 OpenAI DOTS 意在用智能体收拾 ChatGPT 的产品乱局 — mark_k · 2026-09-30