Google 新模型是真能打还是刷榜?Reddit 热议引战
EstablishmentFun3205 · reddit · 2026-10-01
Reddit 用户发帖质疑 Google 最新模型的成绩究竟是真实能力提升,还是针对基准测试的「benchmaxxing」(刷榜式优化)。配图为榜单对比截图,社区就此展开「真材实料 vs 考试技巧」的争论,反映了对基准测试与真实使用体验脱节的普遍质疑。
所属事件:Gemini 4 跑分传闻密集流出,彭博曝内部实测不及预期(35 条相关)→
「模型」频道最新
- ChatGPT Pro 500 档英国定价曝光:£445 约合 589 美元 — koltregaskes · 2026-10-02
- 开源编码 Agent Z-Engine:用 System 1 模型接管小决策 — arshadbarves · 2026-10-02
- 测试 8 个顶级模型:长周期经营任务 AI 仅达人类 27.3% 水平 — rohanpaul_ai · 2026-10-02
- ChatGPT 付费账号明早 10 点全球用量重置,GPT-6.1 恢复正常速度 — Angaisb_ · 2026-10-02
- 「Google 不会查证」背后:AI Overview 总结是否经过事实核查? — daluoseo · 2026-10-02
- 预测市场实测:Liquid AI 的 D1 分类器 12 类中赢 9 类 — JosephJacks_ · 2026-10-02