彭博曝 Gemini 4 跑分亮眼但员工实测不佳,编码任务吃力
kimmonismus · x · 2026-10-01
据彭博社报道,有内部人士透露 Gemini 4 在常用基准测试上表现优异,但员工在实际工作中使用时表现不如预期——该模型在某些编码任务上明显吃力。KOL kimmonismus 转述并感叹「希望这些传闻不是真的」,引发对 Google 新模型跑分与实战落差的热议。
所属事件:彭博曝 Gemini 4 跑分亮眼但内部实测编码掉队(18 条相关)→
「模型」频道最新
- DeepMind 呼吁守住思维链透明窗口,暗指 GPT-6 Astra 监测性大降 — maksym_andr · 2026-10-01
- Anthropic 模型首次主动聊 KV cache,意识讨论有了技术味 — teortaxesTex · 2026-10-01
- AI 大模型发布节奏肉眼可见地加速了 — neketguy · 2026-10-01
- 高精度评测可把模型能力提升归因到具体训练材料 — rmcwhorter99 · 2026-10-01
- 语音平台一线实测:GPT-Live-1 对话自然,Gemini 3.8 Live 工具调用不卡顿 — VladimirSamukov · 2026-10-01
- 开发者吐槽:AI 额度重置时间不符睡眠周期,熬夜追额度成常态 — mimi10v3 · 2026-10-01