谷歌六周内第三发:Gemini 3.8 Flash 发布,附网络安全专用版
机器之心 · wechat · 2026-09-03
谷歌深夜发布 Gemini 3.8 Flash,这是六周内第三款 Flash 系列模型,定价与 3.7 Flash 持平(输入 $0.75/百万 Token,输出 $3.75/百万 Token),重点强化软件工程、Agent 任务和多步推理。
要点
- 性能:DeepSWE v1.1 长周期软件工程测试中超过多数更大的前沿模型;HLE-Verified 得分 54.9%;在金融与法律 Agent 基准上也超过前代。设计上通过投入更多计算(更多推理步骤与工具调用)换取性能,开发者可调低推理强度省 Token。
- Gemini 3.8 Flash Cyber:面向网络安全,漏洞发现基准 CyberGym 上达前沿水平;内部基准(20 种语言)漏洞发现成功率超 70%;CWE-Bench 补丁修复 Pass@1 为 47.2%,接近前沿模型的 47.8% 但成本更低。通过 Fairwind Program 向认证安全人员开放。
- 实际应用:Chrome 团队称其生成的正确修复补丁比更大的商业模型多 2.6 倍;Wiz 渗透测试中召回率提升 7.5%9.7%,成本降低 2.35.2 倍;Google 云团队用它不到 2 小时发现一个此前需数月才能找到的关键漏洞。
模型已在 AI Studio、Gemini App 等渠道开放。谷歌 DeepMind 姚顺宇称这对 RSI(递归自我改进)是巨大飞跃。
所属事件:Google 发布 Gemini 3.8 Flash 与网络安全专用 Cyber 版(100 条相关)→
「模型」频道最新
- 开发者实测:Muse Spark 系列模型成本、性能、延迟全面逊于 Luna — bindureddy · 2026-09-03
- Gemini Flash 更新快但谄媚难改,用户吐槽缺独立判断 — oran_ge · 2026-09-03
- 无视觉能力的 GLM 5.3 把图片转 ASCII 画来读图,工程味拉满 — _AndrewZhao · 2026-09-03
- Gemini 3.8 Flash 实战艾尔登法环:通关 Radahn boss 战,视角操控仍欠火候 — No-Elderberry-7785 · 2026-09-03
- Sebastian Raschka 拆解 The Information 的 OpenAI Astra「循环Transformer」传闻 — rasbt · 2026-09-03
- Gemini 3.8 Flash、Muse Spark 1.3 接连现身,DeepSWE 被碾压 — zainhas · 2026-09-03