Bloomberg:Gemini 4 跑分漂亮,内部员工实测编码却掉链子
firstadopter · x · 2026-10-01
Bloomberg 报道,Google 在筹备 Gemini 4 发布之际,内部对其旗舰模型在关键领域的实际表现存在质疑。
- 消息人士称,Gemini 4 在行业通用基准测试上表现出色,但员工实际投入使用时效果不及预期
- 模型在部分编码任务上表现挣扎,内部员工匿名讨论此事
- 发帖人 firstadopter 指出,Google 模型历来有「刷榜」倾向:基准成绩好于真实使用体验,真正好坏要等开发者上手后才见分晓
这篇报道与发布前的宣传形成反差,值得结合后续开发者实测观察。
所属事件:彭博曝Gemini 4跑分亮眼但内部实测编码不及预期(5 条相关)→
「模型」频道最新
- 元素名抢注大战:Neon 和 Argon 已被拿下,Krypton 花落谁家? — tkipf · 2026-10-01
- Gemini 4 Argon 逼近 OpenAI 与 Anthropic,AI 榜单仍未分出胜负 — balianone · 2026-10-01
- 传 Gemini 4 Argon 初期仅面向 Ultra 订阅用户开放 — opmgyhx · 2026-10-01
- 学者质疑:模型无提示复现视频梗中免责声明,难道不是理解? — technollama · 2026-10-01
- 和 LLM 聊数理像与「偏科天才」合作:会解题却缺大局观 — burny_tech · 2026-10-01
- 博主一句话评价:GPT-6.1 Sol 被低估了 — mallow610 · 2026-10-01