Decision Index 0.1 发布:向每个模型提问 13 万次横评 30+ 决策模型
multimodalart · x · 2026-09-22
multimodalart 发布了 Decision Index 0.1,一个针对决策模型的严谨排行榜。
- 对比 Jev 与 30+ 开源权重决策模型
- 覆盖 35+ 个基准,向每个模型提问 13 万次
- 测试维度包括知识、自动化、理解和创造力
为决策类模型(而非语言聊天能力)提供了少见的大规模横评。
所属事件:Decision Index 0.1 发布:13 万次提问实测 Jev 与 30+ 开源决策模型(7 条相关)→
「模型」频道最新
- Claude 按Token计数不按条数,9 招避免额度爆掉 — HeyAmit_ · 2026-09-22
- 疑似 OpenAI「Aeon 持久 Agent」新信息流出,截图曝光 — PrisonOfH0pe · 2026-09-22
- 新基准 Decision Index 0.1 跑 13.2 万次决策,Jev 仍以 59.5 居首 — victormustar · 2026-09-22
- 网友用 Pelican SVG 测试对比 GPT-6 Astra 与 Anthropic 新模型 — PrisonOfH0pe · 2026-09-22
- Reddit 用户反映 Gemini Pro 网页搜索功能疑似被禁用 — zsolt67 · 2026-09-22
- M5 Ultra 跑 Qwen 达 3740 tok/s prefill,一天内翻倍震惊业界 — EAccelerate_42 · 2026-09-22