曝 Gemini 4 刷榜遭内部质疑,实机表现逊于跑分

QuintinPope5 · x · 2026-10-01

据 Bloomberg 报道,有直接接触 Gemini 4 的 Google 员工认为该模型在基准测试上的表现明显好于实际使用体验,编程场景尤其突出,被指 "benchmaxxing"。有人质疑它是否会成为首个在部署前就被 "削弱" 的模型。Google 否认这一说法,称内部对 "Gemini 4 处于前沿水平" 存在广泛共识。消息尚未获独立证实,属可信媒体报道的爆料。

所属事件:彭博曝 Gemini 4 跑分亮眼,谷歌内部实测编码掉队(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →