AI基准测试遭质疑:Meta等被指定制数据
iruletheworldmo · x · 2026-07-09
评论指出当前的AI基准测试正变得越来越无关紧要,并呼吁在面对厂商发布的成绩时保持分析眼光。推文特别点名批评Meta AI的负责人,称其参与设计的“人类最后考试”中,模型表现不及GPT 5.5和Claude Opus的编码基准。此外,推文还指控Grok 4.5的核心基准测试也是由其团队完全妥协并自行设计的。
所属事件:Meta等AI厂商基准测试成绩遭质疑(2 条相关)→
「模型」频道最新
- 有人称 OpenAI 和 Anthropic 抱怨中国开源权重模型很荒谬 — krishnan · 2026-07-21
- PrismML Bonsai 27B 量化后仅 3.8GB 可手机运行 — tony10000 · 2026-07-21
- actAVA AI 推出 1T 参数医疗代理模型 Cura — _akhaliq · 2026-07-21
- 有人觉得 Claude Fable 出现了更像 Gemini 的僵硬感 — teortaxesTex · 2026-07-21
- Reddit 实测:z.ai 上的 GLM-5.2 确实能网页搜索 — Umr_at_Tawil · 2026-07-21
- Kimi CEO 称 token 效率才是 Kimi 3 的新优势 — HowDevelop · 2026-07-21