专题 · FULL STORY

Decision Index:开源决策模型榜单快速迭代

HuggingFace 团队成员 multimodalart 于 9 月 22 日发布开源决策模型排行榜 Decision Index 0.1,基于 13 万次决策横评 30+ 模型,Jev 居首。两天后 0.2 版随即推出,改进计算公式并新增 50 个模型,Perplexity CTO 模型登顶。

2026-09-22 ~ 2026-09-24 · 2 集 · 9 条

第 1 集 · Decision Index 0.1 发布:13 万次决策横评 30+ 开源决策模型,Jev 居首(2026-09-22,7 条)

multimodalart(Hugging Face 团队成员)于 09-22 发布 Decision Index 0.1,一个针对开源权重决策模型的严谨排行榜。该项目覆盖 37 个基准、5 大类别任务,共运行 132,422 次决策,向每个模型提问约 13 万次,不做截断,从知识、自动化、理解力与创造力四个维度对比 Jev 及其复现版本在内的 30 多个开源权重决策模型。结论是 Jev 以 59.5 分领跑开源模型,工具使用类差距正在缩小。全部测试在同一硬件(单张 RTX 6000 Pro)上完成,且基准刻意设置得较难,避免发布即饱和。

已确认

  • Decision Index 0.1 由 multimodalart 于 09-22 发布,属于 Hugging Face 团队项目
  • 评测规模:37 个基准、5 大类别、132,422 个决策、每模型约 13 万次提问(multimodalart 自己的部分帖子称 35+ 个基准,victormustar 转述为 37 个)
  • 评测对象为 Jev 及其复现版本,共 30+ 个开源权重决策模型
  • 评测维度包括知识、自动化、理解力、创造力
  • Jev 以 59.5 分居首,仍是开源模型领跑者;工具使用类差距正在缩小;榜单前列还提到 Qwen3.8-27B 与 diffusion gemma 单次推理等
  • 全部评测在单张 RTX 6000 Pro 上运行,基准刻意设置得较难,避免发布即饱和

为什么重要

  • 据 victormustar 转述,Jev 发布仅一周已有 31 个复现版本,但此前多数对比只跑几百次决策,样本量小、结论不可靠
  • Decision Index 0.1 以十万量级的决策测试、不做截断、统一硬件的方式,为决策模型提供了更具统计可信度的横评基准

第 2 集 · Decision Index 0.2 发布,Perplexity CTO 模型登顶开源榜(2026-09-24,2 条)

Multimodal Art 发布 Decision Index 0.2 版本排行榜,相较 0.1 改进了计算公式,新增 29 个 Jev 类模型和 21 个 benchmark。在更新后的榜单中,Perplexity CTO 以 3000 美元训练出的 AutoJev-27B 登顶开源决策模型榜首,引发社区关注。