37 项基准、每模型 13 万次决策:jeff 擅长工具与自动化任务
multimodalart · x · 2026-09-22
multimodalart 介绍一项自建基准:对参评模型共跑 37 个基准、覆盖 5 大类任务,每个模型 13 万次决策,全部在同一硬件(1x RTX 6000 PRO)上运行。基准刻意设置得较难,避免发布即饱和。jev 在各类任务上的表现显示其尤其擅长工具使用与自动化任务。
所属事件:Decision Index 0.1 发布:13 万次提问实测 Jev 与 30+ 开源决策模型(7 条相关)→
「模型」频道最新
- Claude 按Token计数不按条数,9 招避免额度爆掉 — HeyAmit_ · 2026-09-22
- 疑似 OpenAI「Aeon 持久 Agent」新信息流出,截图曝光 — PrisonOfH0pe · 2026-09-22
- 新基准 Decision Index 0.1 跑 13.2 万次决策,Jev 仍以 59.5 居首 — victormustar · 2026-09-22
- 网友用 Pelican SVG 测试对比 GPT-6 Astra 与 Anthropic 新模型 — PrisonOfH0pe · 2026-09-22
- Reddit 用户反映 Gemini Pro 网页搜索功能疑似被禁用 — zsolt67 · 2026-09-22
- M5 Ultra 跑 Qwen 达 3740 tok/s prefill,一天内翻倍震惊业界 — EAccelerate_42 · 2026-09-22