网友质疑 Google 新模型狂欢:基准成绩从来不可靠
Angaisb_ · x · 2026-10-01
作者对 X 上一片「Google 翻盘」的欢呼泼冷水:模型还无法实际使用,而且 Google 的模型基准成绩历来不可靠,作者提醒别忘了 Gemini 3 Pro 当年的先例,暗示宣传与实际能力之间可能存在落差。
所属事件:Google 新模型获追捧遭网友泼冷水:跑分未必可信(2 条相关)→
「模型」频道最新
- Gemini 4 Argon 在 AA Coding Agent Index 编码测试表现亮眼 — prateeky2806 · 2026-10-01
- Anthropic 评估:GLM-5.3 可自主构建 Chrome 漏洞利用,防护近乎为零 — matthew_d_green · 2026-10-01
- Artificial Analysis 公布 Solar Mini 4 完整智能指数测试结果 — ArtificialAnlys · 2026-10-01
- Upstage 发布 Solar Mini 4:3B 激活参数拿下 Intelligence Index 24 分 — ArtificialAnlys · 2026-10-01
- 红队测试 GLM 5.3 发现诡异输出,怀疑 OpenRouter 路由到 1bit 量化版 — voooooogel · 2026-10-01
- 谷歌员工自曝 Gemini 4 擅长长上下文:摄取与长序列生成都强 — RubenEVillegas · 2026-10-01