Bloomberg 曝 Gemini 4 跑分强但实战拉胯,编码任务吃力

kimmonismus · x · 2026-10-01

据 Bloomberg 报道,Gemini 4 在常用基准测试上表现不错,但谷歌内部员工实际使用时发现它在真实任务上不如跑分所示,尤其是部分编码任务处理吃力。消息人士称,谷歌内部对它是否已追上 OpenAI 和 Anthropic 意见不一。这是典型的 benchmark 与实战表现脱节的案例,内部分歧本身也说明追赶存疑。

所属事件:彭博曝 Gemini 4 跑分亮眼但内部实测编码掉队(18 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →