Gemini 3.6 Flash 在真实任务榜得 1421 分
teortaxesTex · x · 2026-07-22
这条帖子在讨论 Google Gemini 3.6 Flash 的进展,并给出一张真实任务榜单截图。
- 发帖者认为,和 3.5 相比,3.6 已经算有进步,但“还是得上更大的模型”。
- 截图是 GDPval-AA v2 leaderboard,衡量的是现实工作任务表现,基线设为人类 1000 分。
- 榜单里前排包括 Claude 4.5 (1748)、GPT-5.6 (1736)、Kimi K3 (1679)、Claude Sonnet 5 (1607)、Claude Opus 4.8 (1594) 等。
- Gemini 3.6 Flash 排在 1421,明显低于第一梯队。
- 引用中的 Google 回复称,AA 主要覆盖的是推理基准,所以分数变化不大;他们更关注的是 agentic 场景下的真实任务表现。
所属事件:Gemini 3.6 Flash跑分翻车落后前代(30 条相关)→
「模型」频道最新
- 开源阵营正挑战 AI 双寡头,Kimi K3 先上场 — bindureddy · 2026-07-22
- 通义 Qwen-Image-3.0 可一条长指令生成九张信息图 — xiaohu · 2026-07-22
- 有人吐槽:小算力模型预训练截止到 2025 年 1 月 太离谱 — _arohan_ · 2026-07-22
- Qwen3.8 预览版把阿里开源权重推向企业分发 — krishnan · 2026-07-22
- Google 今天据称放出几款模型,后续还会更多 — bindureddy · 2026-07-22
- 本地模型单提示生成飞行模拟器,6 款模型同台实测 — JLeonsarmiento · 2026-07-22