Artificial Analysis 上线模型对比工具,一次横评五款模型
ArtificialAnlys · x · 2026-10-03
Artificial Analysis 发布 Release Comparison Tool,支持最多五款模型并排对比,可查看:
- 智能指数与单项 benchmark:Intelligence Index、AA-Briefcase、Terminal-Bench、Humanity's Last Exam、SciCode 等
- 细分领域能力指数:金融会计、战略运营、法律、医疗、工程、经济等方向单独打分
- 成本明细:按输入/输出/缓存 token 拆分的单价与每任务成本(示例中同一模型不同推理档位每任务成本从 $0.55 到 $5.98 不等)
- 速度与延迟:输出速度、首 token 延迟、上下文窗口
页面示例对比了 Claude Opus 5.5 与 GPT-6 Astra 各推理档位:更高推理档位智能分更高,但每任务成本也数倍上升,低档位则速度快、成本低但分数明显下滑,直观呈现「推理投入 vs 成本」的取舍。
「模型」频道最新
- Cloudflare 决策模型 Clef 上架 Ollama,可分类图片与工单路由 — ollama · 2026-10-03
- Clef Flash 细节:9B 多模态决策模型,基于 Qwen3.5 微调 — ollama · 2026-10-03
- 「随机统计预测」是误解:模型内部存在被学到的算法结构 — burny_tech · 2026-10-03
- Jev 架构挑战前沿模型:每百万输入仅 0.042 美元,估值冲百亿 — mattturck · 2026-10-03
- Google 调整 Gemini 分级访问:不同订阅档位可用模型与额度分层 — QH96 · 2026-10-03
- Meta 开源 Muse 模型代码,想让 AI 进驻电视和家电 — TechCrunch AI · 2026-10-03