Artificial Analysis 发布 v4.1 智能指数榜单
ArtificialAnlys · x · 2026-07-31
Artificial Analysis 更新了 AI 模型评测体系,发布了 Intelligence Index v4.1 榜单。该榜单引入了 GDPval-AA v2、Terminal-Bench v2.1、Humanity's Last Exam 等多项新评测,对市面上的主流开源与闭源模型在智能、速度、延迟、价格和上下文窗口等维度进行了综合对比。
「模型」频道最新
- 同价位大模型实测:DeepSeek V4-Flash 多模态胜过 GPT-5.6 Luna — teortaxesTex · 2026-07-31
- DeepSeek V4-Flash 性能暴涨,或因 V4-Pro 充当 RL 教师 — teortaxesTex · 2026-07-31
- DeepSeek 推理 RL 训练受赞,规避模型废话与幻觉 — teortaxesTex · 2026-07-31
- 实测对比:o3 在 OSINT 任务中表现依然强悍 — bytebot · 2026-07-31
- 曝 Gemini 3.5 Pro 或于本周末发布 — gaganghotra_ · 2026-07-31
- Kimi RL 训练实力获赞:有效避免幻觉与废话 — teortaxesTex · 2026-07-31