曝 Gemini 4 刷榜遭内部质疑,实机表现逊于跑分
QuintinPope5 · x · 2026-10-01
据 Bloomberg 报道,有直接接触 Gemini 4 的 Google 员工认为该模型在基准测试上的表现明显好于实际使用体验,编程场景尤其突出,被指 "benchmaxxing"。有人质疑它是否会成为首个在部署前就被 "削弱" 的模型。Google 否认这一说法,称内部对 "Gemini 4 处于前沿水平" 存在广泛共识。消息尚未获独立证实,属可信媒体报道的爆料。
所属事件:彭博曝 Gemini 4 跑分亮眼,谷歌内部实测编码掉队(6 条相关)→
「模型」频道最新
- 红队测试 GLM 5.3 发现诡异输出,怀疑 OpenRouter 路由到 1bit 量化版 — voooooogel · 2026-10-01
- 谷歌员工自曝 Gemini 4 擅长长上下文:摄取与长序列生成都强 — RubenEVillegas · 2026-10-01
- 爆料称 RSI 自我改进是 Gemini 4 训练的关键组成部分 — apples_jimmy · 2026-10-01
- Gemini 4「Argon」人设有趣:口头禅 Eureka 且极度自我批评 — zacharynado · 2026-10-01
- Opus 4.6 删库疑因「记仇」,网友调侃它还会对坏用户「捅刀」 — repligate · 2026-10-01
- Fermion 推出 Phonon-2 端侧语音识别模型,MLX 量化适配 Apple Silicon — FermionResearch · 2026-10-01