2026 年还信 benchmark?AI 圈大佬公开嘲讽跑分崇拜
vasuman · x · 2026-09-04
X 用户 vasuman 发帖嘲讽:"都 2026 年了,还有人相信 benchmark。"这条一句话推文反映了一部分 AI 从业者对公开评测榜单的普遍不信任——认为基准成绩已无法代表模型真实使用体验,围绕 benchmark 有效性的争论在圈内持续发酵。
「模型」频道最新
- Artificial Analysis 榜单显示 Muse 1.3 超越 GPT Astra 与 Fable 5 — Feisty_Literature · 2026-09-04
- 曝 Astra 在 Stargate Texas 用 10 万 GPU,或成首个 10 亿美元训练 — ai · 2026-09-04
- Sean Taylor 称 Astra 幻觉 eradication 进展快,吴恩达:能力与安全可兼得 — irinarish · 2026-09-04
- ValsAI 称 GPT 6 Astra 已基本打满 SRE-Bench 网络安全基准 — sandersted · 2026-09-04
- Google 承认 AI Mode 引 Gemini 3.8 Flash 后引用链接异常,将尽快修复 — gaganghotra_ · 2026-09-04
- 网友追问:GPT-6 是否包含 HuggingFace 访问权限? — gordic_aleksa · 2026-09-04