一个新 AI 智力指数试图跨越变化基准追踪进展
pranjalssh · x · 2026-08-04
- 这条帖子的核心观点是:如果直接把不同时期的 benchmark 分数拼起来,没法可靠比较“今天最强模型比 2025 年强多少”,因为 benchmark 本身一直在变。
- 作者提出了一个基于 Artificial Analysis 分数的intelligence index,设计成只会上升,用来更稳定地观察前沿进展。
- 配图也在说明同一个问题:榜单上公布的最高分可能会下降,但这并不代表 frontier 停滞,更多反映的是衡量标准和测评版本在变化。
「模型」频道最新
- 对比图里 DeepSeek 价格低到像没被画进去 — tokenbender · 2026-08-04
- 前沿模型编码更强了,但写作质量似乎退步 — HamelHusain · 2026-08-04
- 多款 LLM 识别同一飞机和航空公司都翻车 — airbus_a360_when · 2026-08-04
- Qwen3.8-Max 设计测试追平 GPT-5.6,价格仅四分之一 — alejandroll10 · 2026-08-04
- Anthropic 的 Fable 5 被指近期明显退化 — _ghostchant · 2026-08-04
- DeepSeek V4-Flash 价格低到一局游戏只要几分钱 — 量子位 · 2026-08-04