六周三连发:Gemini 3.8 Flash 长程编程超越多数更大模型
CodeByPoonam · x · 2026-09-03
Google 六周内连发三款 Flash 模型,今日推出 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,二者共享同一核心智能。
3.8 Flash(通用模型)
- 在长程软件工程基准 DeepSWE v1.1 上超过多数更大的前沿模型
- 在金融与法律推理基准(Vals Finance Agent V2、Harvey Legal Agent Benchmark)上领先
- HLE-Verified 得分 54.9%,覆盖 STEM、人文与专业领域的多步推理
- 定价与 3.7 Flash 持平:输入 $0.75/M、输出 $3.75/M tokens
3.8 Flash Cyber
- 专攻漏洞挖掘,在 CyberGym 基准上超越更大模型,成功率超 70%
- 仅通过 Google 新的 Fairwind Program 向受信任的防御者开放
Logan Kilpatrick 确认这是 6 周内第三个更新的 Flash 模型,主打 agentic 与编码能力提升。
所属事件:Google 发布 Gemini 3.8 Flash 与安全专用 Cyber 版(104 条相关)→
「编程与Agent」频道最新
- Jeff Dean 提及 token 统计工具 tokscale,作者惊喜获大佬背书 — doodlestein · 2026-09-03
- t3 被「锤」:UI 设计被指抄袭 Codex 桌面版 — CtrlAltDwayne · 2026-09-03
- Eno Reyes:用好模型不能只靠路由,Agent 需有状态地分配智能 — matanSF · 2026-09-03
- 开发者开源 LLM 测试包装器,用日志与检查门降低模型出错 — Tyb0wls · 2026-09-03
- Meta 改 WhatsApp 按条计费,多轮 Agent 成本翻三倍 — uriwa · 2026-09-03
- Agent Harness 应该极简:只要循环+工具调用,别上插件 — uriwa · 2026-09-03