AA 智能指数把 Muse Spark 排在 GPT-6 之上,权威性遭质疑
_weiping · x · 2026-09-04
DanDr1s 质疑 Artificial Analysis Intelligence Index 的公信力:其将 Muse Spark 1.3(62 分)排在 GPT-6 Astra(61 分)之上,但 GPT-6 Astra 在各专项 benchmark 上成绩碾压——ARC-AGI-3 达 98.6%、FrontierMath 97.6%、ExploitBench 100%。
weiping 补充观点:单一数字总榜单本就误导,针对它 benchmaxxing 比刷任何单项 benchmark 危害更大——它掩盖关键能力差异,且不在 AA Index 里的有意义 benchmark 会被迅速轻视。
「模型」频道最新
- Astra 无需 CoT 得 ARC-AGI-3 97%、ARC-AGI-1 86% — FeeAvailable3770 · 2026-09-04
- GPT-6 Astra 刷新 ARC-AGI 纪录:标准测试 62.7%,新架构下达 99.9% — repligate · 2026-09-04
- 浏览器截图实测:GLM 5.3 Flash 胜过 DeepSeek V4 Flash Vision — Certain_Pension6305 · 2026-09-04
- Reddit 用户质疑 Artificial Analysis 数据可信:同一模型同榜分数不一 — metigue · 2026-09-04
- OpenCode 匿名模型 Omen Alpha 疑似智谱新 GLM,定价约贵六成 — teortaxesTex · 2026-09-04
- Apple M5 Ultra 512GB 版可本地跑 97 个开源模型中的 93 个 — bigaiguy · 2026-09-04