antirez:别把 Artificial Analysis 榜单当 LLM 全部真相
antirez · x · 2026-08-18
Redis 作者 antirez 发表观点:如果认同 IQ 无法完整衡量一个人在通用智力任务上的表现,就不应把 Artificial Analysis 的基准分数当作 LLM 在真实世界能力的全部图景。榜单成绩与实际使用体验之间存在差距,选型时不应唯榜单论。
「模型」频道最新
- DeepSeek 测试称其平价 Flash 力压昂贵的 Pro — AccBalanced · 2026-08-18
- 推理模型难伺候?从 Opus 到 Gemma 都被喷 — MerePotato · 2026-08-18
- Gemini 3.7 Flash 上线,Box 与 Databricks 等已投入实战 — DynamicWebPaige · 2026-08-18
- 用户实测 Codex 消耗暴增:半天烧掉 15% 周额度 — GabGarrett · 2026-08-18
- Anthropic Mythos 2 训练完成但不发布,已启动 Mythos 3 — kimmonismus · 2026-08-18
- Qwen3.8-Max 惊现零样本实例分割能力 — iamrobotbear · 2026-08-18