Bloomberg 曝 Gemini 4 跑分强但实战拉胯,编码任务吃力
kimmonismus · x · 2026-10-01
据 Bloomberg 报道,Gemini 4 在常用基准测试上表现不错,但谷歌内部员工实际使用时发现它在真实任务上不如跑分所示,尤其是部分编码任务处理吃力。消息人士称,谷歌内部对它是否已追上 OpenAI 和 Anthropic 意见不一。这是典型的 benchmark 与实战表现脱节的案例,内部分歧本身也说明追赶存疑。
所属事件:彭博曝 Gemini 4 跑分亮眼但内部实测编码掉队(18 条相关)→
「模型」频道最新
- 实测称 OpenAI 疑似把模型速度降至六成以省用户额度 — bdsqlsz · 2026-10-01
- 付费用户曝 ChatGPT Projects 旧对话大面积无法加载,担忧工作记录丢失 — yaxir · 2026-10-01
- 开发者再遇 OpenAI usage 接口故障,ChatGPT 登录凭证被拒 — lucasmeijer · 2026-10-01
- 网友吐槽 DeepSeek V4.1 文生图质量不稳定,不适合当蒸馏目标 — teortaxesTex · 2026-10-01
- 编码不强但综合能打:Gemini 4 在 AI 生产力榜单表现亮眼 — Marimo188 · 2026-10-01
- 体验 12 小时:Ling 3.1 Flash 竟是 560B 参数级模型 — jaykayenn · 2026-10-01