实测称 Gemini 3.8 Flash 过拟合公开基准,较 3.7 不升反降
bindureddy · x · 2026-09-03
开发者 Bindu Reddy 发帖称,Gemini 3.8 Flash 疑似「bench maxxed」(针对公开基准过拟合),在其自建基准上表现反而不如 3.7 Flash:
- 3.8 在其隐藏问题集上成绩更差
- 数据分析能力出现回退
- 结论是这一版本过拟合了公开基准
其呼吁 Google 停止 Flash 小版本迭代,直接推出 Gemini 4.0。为第三方评测结论,未经 Google 官方证实。
「模型」频道最新
- GLM 5.3 与 5.3 Flash 上线 Together Chat,免配置免费试用 — oilmutt · 2026-09-03
- LatchBio 评测发现 Grok 拒答多来自模型自身,竞品靠外层拦截 — kenbwork · 2026-09-03
- 曝 Gemini 3.8 Flash 刷榜过拟合,第三方基准反超 3.7 — bindureddy · 2026-09-03
- Gemini 3.8 Flash 用户满意度双位数提升,可操控性更强 — tokumin · 2026-09-03
- Muse Spark 1.3 冲上榜单第三,首次插入 Claude 与 GPT 之间 — alexandr_wang · 2026-09-03
- Google 研究员调侃 Astra 不展示思考 token 争议:被制造出的焦虑 — rao2z · 2026-09-03