Gemini 3.6 Flash 基准更好看,但回归可能挡住升级
PaiDxng · reddit · 2026-07-22
Google 的 Gemini 3.6 Flash 从官方数字看像是一次明确升级:它在 Artificial Analysis Index 上据称比 3.5 Flash 少用 17% 输出 token,并在 DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 等基准上都有提升,同时输出价格降到 每百万 token 7.50 美元。
但作者提醒,早期截图里提到的前端生成、空间推理回归,还不足以证明它整体更差;这些证据更像是“可以提出回归假设”,而不是定案。帖子的重点其实是评测方法:
- 冻结 prompt、工具、temperature、thinking、重试策略;
- 用相同的代表性任务分别跑旧模型和新模型;
- 把低频但高代价的失败案例也纳入;
- 先定好淘汰门槛,再看结果。
作者主张不要执着于“单一全局最优模型”。如果 3.6 Flash 只在部分任务上赢、但在某个工作流里输了,就应该按任务路由,而不是硬切全量升级。
所属事件:Gemini 3.6 Flash实测性能引争议(4 条相关)→
「模型」频道最新
- Flash 3.6 在简单编程任务上快得离谱 — cgarciae88 · 2026-07-22
- Qwen3.8-Max-Preview 登顶 NVIDIA FlashInfer 推理榜 — Scobleizer · 2026-07-22
- 陶哲轩请 ChatGPT 解释一个“神奇”新定理 — Singularitarian · 2026-07-22
- 用户称 GPT-5.6 是自 GPT-4 以来首次明显跃迁 — koltregaskes · 2026-07-22
- CodePilot 接入 X OAuth 后可免费用 Grok 4.5 — op7418 · 2026-07-22
- GPT-5.5 被展示能解出部分纯泛函分析题 — International-War-73 · 2026-07-22