Google 新模型是真飞跃还是巅峰刷榜?Reddit 热议 benchmaxxing
EstablishmentFun3205 · reddit · 2026-10-01
Reddit 帖子配图对比 Google 新模型(Gemini 4 相关)的评测表现,发帖人质疑这是「真材实料的进步」还是「peak benchmaxxing」——针对基准测试专门优化、实际使用却未必更好。这呼应了彭博社报道中「Gemini 4 跑分漂亮但员工实际使用表现一般」的说法,引发对基准分数与真实能力脱节的讨论。
所属事件:彭博曝 Gemini 4 跑分亮眼但内部实测编码掉队(18 条相关)→
「模型」频道最新
- DeepMind 呼吁守住思维链透明窗口,暗指 GPT-6 Astra 监测性大降 — maksym_andr · 2026-10-01
- Anthropic 模型首次主动聊 KV cache,意识讨论有了技术味 — teortaxesTex · 2026-10-01
- AI 大模型发布节奏肉眼可见地加速了 — neketguy · 2026-10-01
- 高精度评测可把模型能力提升归因到具体训练材料 — rmcwhorter99 · 2026-10-01
- 语音平台一线实测:GPT-Live-1 对话自然,Gemini 3.8 Live 工具调用不卡顿 — VladimirSamukov · 2026-10-01
- 开发者吐槽:AI 额度重置时间不符睡眠周期,熬夜追额度成常态 — mimi10v3 · 2026-10-01