AI 基准是有用还是坏掉了?
sanmikoyejo · x · 2026-08-21
这篇博客简短探讨了 AI 科学家与批评家在基准测试上的沟通错位:一方将其比作指南针(指向方向),另一方视其为证书(能力证明)。这是同一工具的不同属性认知。
「模型」频道最新
- Grok 4.6 追平 Claude Opus 5,并列 Agentic Index 第一 — elonmusk · 2026-08-21
- DeepSeek V4 Pro 跑分 KernelBench,逼近 Opus 5 — teortaxesTex · 2026-08-21
- Liquid AI 推出 DSpark 草稿模型,加速达 4 倍 — JosephJacks_ · 2026-08-21
- 用户反馈 Qwen Uncensored 仍频繁拒答 — BLUECOW009 · 2026-08-21
- Pander Score 榜单揭示主流模型阿谀奉承程度差异 — RobbWiller · 2026-08-21
- Liquid AI 推出 DSpark:推测解码提速最高 3.18 倍 — helloiamleonie · 2026-08-21