SemiAnalysis:Gemini 新模型刷榜痕迹明显,3.5 Pro 仍未现身
firstadopter · x · 2026-09-08
- SemiAnalysis 发推称 Gemini 3.8 Flash 和 Muse Spark 1.3 是「刷榜痕迹最明显」的模型:两者在 Terminal Bench 2.1 上与 GPT-6、Fable 5.1 相当,但在 Terminal Bench 4.0 上表现明显更差。
- firstadopter 转发并吐槽 Google 的 benchmaxxing 名声无人能及,同时追问 Gemini 3.5 Pro 到底在哪里。
「模型」频道最新
- GPT-6 Astra 机器人任务 95% 得分遭质疑:演示难度被美化 — GaryMarcus · 2026-09-08
- 重度用户实测 Astra 后直言:还不是 AGI,只是更强代码猴 — GaryMarcus · 2026-09-08
- Epoch 研究:Astra 打牌超人类但几乎无持续学习 — teortaxesTex · 2026-09-08
- GPT-6 Astra 额度已重置,用满的用户可继续使用 — xiaohu · 2026-09-08
- Astra 计算机使用速度惊人,或为提前规划批量执行 — shekitup · 2026-09-08
- OpenAI 刚刚重置了 Codex 的使用额度 — draginol · 2026-09-08