云模型跑分有了更好看的可视化浏览方式
the3dwin · reddit · 2026-09-15
作者分享了一个从 Twitter 上发现的云端模型基准测试可视化工具,认为它比传统跑分表格更有趣,打算作为自己查看各家模型 benchmark 的首选方式。作者仍认为用编排器按任务自动选最优模型才是最佳实践。
「模型」频道最新
- Atria Dawn Preview 发布:基于 744B MoE 底座,多项 agent 基准领先 — alexcovo_eth · 2026-09-16
- 爆料称 SSI 因行业暂停共识搁置新模型,Ilya 不愿加剧竞赛 — iruletheworldmo · 2026-09-16
- OpenAI 语音服务降价 60%,并推出 ChatGPT 礼品卡 — borowcy · 2026-09-16
- 长文详解:为什么本地跑推理模型是刚需,你需要无审查模型 — HankYeomans · 2026-09-15
- KoboldCpp 发布 v1.121 版本 — Fcking_Chuck · 2026-09-15
- CritPt 基准纠错后 GPT-5.6 pass@4 冲至 94.4% — bookwormengr · 2026-09-15