AI基准测试遭质疑:Meta等被指定制数据

iruletheworldmo · x · 2026-07-09

评论指出当前的AI基准测试正变得越来越无关紧要,并呼吁在面对厂商发布的成绩时保持分析眼光。推文特别点名批评Meta AI的负责人,称其参与设计的“人类最后考试”中,模型表现不及GPT 5.5和Claude Opus的编码基准。此外,推文还指控Grok 4.5的核心基准测试也是由其团队完全妥协并自行设计的。

所属事件:Meta等AI厂商基准测试成绩遭质疑(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →