专题 · FULL STORY
Decision Index:开源决策模型榜单快速迭代
HuggingFace 团队成员 multimodalart 于 9 月 22 日发布开源决策模型排行榜 Decision Index 0.1,基于 13 万次决策横评 30+ 模型,Jev 居首。两天后 0.2 版随即推出,改进计算公式并新增 50 个模型,Perplexity CTO 模型登顶。
2026-09-22 ~ 2026-09-24 · 2 集 · 9 条
第 1 集 · Decision Index 0.1 发布:13 万次决策横评 30+ 开源决策模型,Jev 居首(2026-09-22,7 条)
multimodalart(Hugging Face 团队成员)于 09-22 发布 Decision Index 0.1,一个针对开源权重决策模型的严谨排行榜。该项目覆盖 37 个基准、5 大类别任务,共运行 132,422 次决策,向每个模型提问约 13 万次,不做截断,从知识、自动化、理解力与创造力四个维度对比 Jev 及其复现版本在内的 30 多个开源权重决策模型。结论是 Jev 以 59.5 分领跑开源模型,工具使用类差距正在缩小。全部测试在同一硬件(单张 RTX 6000 Pro)上完成,且基准刻意设置得较难,避免发布即饱和。
已确认
- Decision Index 0.1 由 multimodalart 于 09-22 发布,属于 Hugging Face 团队项目
- 评测规模:37 个基准、5 大类别、132,422 个决策、每模型约 13 万次提问(multimodalart 自己的部分帖子称 35+ 个基准,victormustar 转述为 37 个)
- 评测对象为 Jev 及其复现版本,共 30+ 个开源权重决策模型
- 评测维度包括知识、自动化、理解力、创造力
- Jev 以 59.5 分居首,仍是开源模型领跑者;工具使用类差距正在缩小;榜单前列还提到 Qwen3.8-27B 与 diffusion gemma 单次推理等
- 全部评测在单张 RTX 6000 Pro 上运行,基准刻意设置得较难,避免发布即饱和
为什么重要
- 据 victormustar 转述,Jev 发布仅一周已有 31 个复现版本,但此前多数对比只跑几百次决策,样本量小、结论不可靠
- Decision Index 0.1 以十万量级的决策测试、不做截断、统一硬件的方式,为决策模型提供了更具统计可信度的横评基准
- Decision Index 0.1 发布:35+ 基准 13 万问评测 30 多个开源决策模型 — multimodalart · 2026-09-22
- Decision Index 0.1 发布:向每个模型提问 13 万次横评 30+ 决策模型 — multimodalart · 2026-09-22
- Decision Index 0.1:13 万次提问实测 jev 与 30+ 开源决策模型 — multimodalart · 2026-09-22
- Decision Index 排行榜:jev 领跑开源模型,工具使用类差距缩小 — multimodalart · 2026-09-22
- 37 项基准 13 万次决策:单卡 RTX 6000 Pro 实测本地模型排行 — multimodalart · 2026-09-22
- 37 项基准、每模型 13 万次决策:jeff 擅长工具与自动化任务 — multimodalart · 2026-09-22
- 新基准 Decision Index 0.1 跑 13.2 万次决策,Jev 仍以 59.5 居首 — victormustar · 2026-09-22
第 2 集 · Decision Index 0.2 发布,Perplexity CTO 模型登顶开源榜(2026-09-24,2 条)
Multimodal Art 发布 Decision Index 0.2 版本排行榜,相较 0.1 改进了计算公式,新增 29 个 Jev 类模型和 21 个 benchmark。在更新后的榜单中,Perplexity CTO 以 3000 美元训练出的 AutoJev-27B 登顶开源决策模型榜首,引发社区关注。
- Decision Index 0.2 发布:Perplexity CTO 模型登开源榜首 — multimodalart · 2026-09-24
- Perplexity CTO 用 3000 美元训出 AutoJev-27B,登顶开源决策模型榜 — antoine_chaffin · 2026-09-24