Decision Index 0.1:13 万次提问实测 jev 与 30+ 开源决策模型
multimodalart · x · 2026-09-22
multimodalart 推出 Decision Index 0.1,一个严格的开源模型排行榜:35+ 项基准、向每个模型提问 13 万次,覆盖知识、自动化、理解力与创造力四个维度,对比 jev 与 30 多个开源权重决策模型。
结论:jev 仍在开源模型中领先,总体知识上优势明显(推测背后是更大的模型);但在工具使用/自动化、检索和分类任务上,追赶者已非常接近。
所属事件:Decision Index 0.1 发布:13 万次决策横评,Jev 以 59.5 分领跑开源(7 条相关)→
「模型」频道最新
- 针对特定任务,LLM 之外存在更便宜更有效的技术 — evilsocket · 2026-09-22
- cloneofsimo:学界严重低估 OpenAI 数学 Agent 已解决的问题量 — cloneofsimo · 2026-09-22
- KDDI 创始人实测:让 AI 自评新旧输出质量,性能自动回稳 — i_dg23 · 2026-09-22
- Qwen3.8 无新 MoE 发布,社区疑虑阿里是否放弃 35B A3B 线 — Akainu_Fan · 2026-09-22
- 疑似新 Claude 将至?用户称 Opus 开始表现像 Sonnet — RyanMorrisonJer · 2026-09-22
- Grok 4.7 发布后,Reddit 提议按「每可用任务成本」而非 token 价评估模型 — Crescitaly · 2026-09-22