Gemini 3.6 Flash 基准更好看,但回归可能挡住升级
PaiDxng · reddit · 2026-07-22
Google 的 Gemini 3.6 Flash 从官方数字看像是一次明确升级:它在 Artificial Analysis Index 上据称比 3.5 Flash 少用 17% 输出 token,并在 DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 等基准上都有提升,同时输出价格降到 每百万 token 7.50 美元。
但作者提醒,早期截图里提到的前端生成、空间推理回归,还不足以证明它整体更差;这些证据更像是“可以提出回归假设”,而不是定案。帖子的重点其实是评测方法:
- 冻结 prompt、工具、temperature、thinking、重试策略;
- 用相同的代表性任务分别跑旧模型和新模型;
- 把低频但高代价的失败案例也纳入;
- 先定好淘汰门槛,再看结果。
作者主张不要执着于“单一全局最优模型”。如果 3.6 Flash 只在部分任务上赢、但在某个工作流里输了,就应该按任务路由,而不是硬切全量升级。
所属事件:Gemini 3.6 Flash 评测:更快更省但未变更聪明(16 条相关)→
「模型」频道最新
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11