Decision Index 排行榜:jev 领跑开源模型,工具使用类差距缩小
multimodalart · x · 2026-09-22
multimodalart 发布 Decision Index 0.1 排行榜,用 35+ 基准、向每个模型提问 13 万次,从知识、自动化、理解到创造力四个维度严格对比 jev 与 30 多个开源权重模型。
结果显示:jev 仍在开源模型中领先,总体知识项优势明显(推测是更大模型);但在工具使用/自动化、检索与分类上,开源模型已十分接近。紧随其后的包括:支持单次推理 Qwen3.8-27B 与 diffusion gemma 的新推理技术(无需微调),以及第三名 Decider 35B-A3B——基于 Qwen3.5 35B base 的强微调版本。
所属事件:Decision Index 0.1 发布:13 万次决策横评,Jev 以 59.5 分领跑开源(7 条相关)→
「模型」频道最新
- 针对特定任务,LLM 之外存在更便宜更有效的技术 — evilsocket · 2026-09-22
- cloneofsimo:学界严重低估 OpenAI 数学 Agent 已解决的问题量 — cloneofsimo · 2026-09-22
- KDDI 创始人实测:让 AI 自评新旧输出质量,性能自动回稳 — i_dg23 · 2026-09-22
- Qwen3.8 无新 MoE 发布,社区疑虑阿里是否放弃 35B A3B 线 — Akainu_Fan · 2026-09-22
- 疑似新 Claude 将至?用户称 Opus 开始表现像 Sonnet — RyanMorrisonJer · 2026-09-22
- Grok 4.7 发布后,Reddit 提议按「每可用任务成本」而非 token 价评估模型 — Crescitaly · 2026-09-22