被指刻意回避:Google 基准表遗漏 Sol、Opus 与 Fable 引发质疑
zacharynado · x · 2026-10-01
zacharynado 补发了一张模型对比表格,并引用 @makeamarkery 的批评:Google 在对比中「刻意 omit 了 Sol、Opus 和 Fable」,认为这是因为「Google 落后太多了」。这一针对 Google 模型评测口径选择性的指控在 X 上流传,附有完整对比表链接。
「模型」频道最新
- Gemini 4 被 cua-bench 实测拖后腿:游戏操控表现「尖刺化」 — burny_tech · 2026-10-01
- Harvey 法律基准现数据打架:Argon 19.6% 对 25.42% — 3scorciav · 2026-10-01
- 爆料称谷歌 Gemini 4 Argon 已悄然上线,速度远超预期 — Dr_Singularity · 2026-10-01
- 3.6B 本地模型 TwIL-LM3-Pro 形式逻辑碾压 VibeThinker-3B 达 35% — rohanpaul_ai · 2026-10-01
- 实测:Sol 6.1 推理速度比 Opus 慢近 6 倍,但 token 效率更高 — RexDouglass · 2026-10-01
- AA 智能指数被质疑:Sonnet 5.5 竟高于 fable 5.1 — Ill_Distribution8517 · 2026-10-01