Decision Index 0.1 发布:13 万次决策实测 30 多个开源模型
multimodalart(Hugging Face 团队成员)发布 Decision Index 0.1,一个针对开源权重决策模型的严谨排行榜。该项目使用 35+ 个基准、向每个模型提问 13 万次(victormustar 转述具体数字为 132,422 个决策,覆盖 37 个基准),不做截断,从知识、自动化、理解力与创造力四个维度,对比 Jev 与 30 多个开源权重决策模型。结论是 Jev 仍以 59.5 分领跑开源模型,工具使用类差距正在缩小。
已确认
- Decision Index 0.1 由 multimodalart 于 09-22 发布,属于 Hugging Face 团队项目
- 评测规模:35+ 个基准(victormustar 提到 37 个)、132,422 个决策、每模型约 13 万次提问
- 评测对象为 Jev 及其复现版本,共 30+ 个开源权重决策模型
- 评测维度包括知识、自动化、理解力、创造力
- Jev 以 59.5 分居首,仍是开源模型领跑者
为什么重要
- 据 victormustar 转述,Jev 发布仅一周已有 31 个复现版本,但此前多数对比只跑几百次决策,样本量小、结论不可靠
- Decision Index 0.1 以十万量级的决策测试、不做截断的方式,为决策模型提供了更具统计可信度的横评基准
2026-09-22 ~ 2026-09-22 · 7 条相关
一手来源
- Decision Index 0.1 发布:向每个模型提问 13 万次横评 30+ 决策模型 — multimodalart ·
- 新基准 Decision Index 0.1 跑 13.2 万次决策,Jev 仍以 59.5 居首 — victormustar ·
- Decision Index 排行榜:jev 领跑开源模型,工具使用类差距缩小 — multimodalart ·
- Decision Index 0.1 发布:35+ 基准 13 万问评测 30 多个开源决策模型 — multimodalart · 2026-09-22
- Decision Index 0.1:13 万次提问实测 jev 与 30+ 开源决策模型 — multimodalart · 2026-09-22
- 37 项基准 13 万次决策:单卡 RTX 6000 Pro 实测本地模型排行 — multimodalart · 2026-09-22
- 37 项基准、每模型 13 万次决策:jeff 擅长工具与自动化任务 — multimodalart · 2026-09-22
- 【源头】新基准 Decision Index 0.1 跑 13.2 万次决策,Jev 仍以 59.5 居首 — victormustar · 2026-09-22
另有 2 条近重复转述:multimodalart · multimodalart