Google 发布 Gemini 3.8 Flash:干得更多但可能花更多 token
The Verge AI · rss · 2026-09-03
Google 在 Gemini 3.7 Flash 发布仅数周后推出 Gemini 3.8 Flash,宣称新模型在复杂任务上会执行更多推理步骤并迭代调用工具,"干活更卖力"。引入定价与 3.7 Flash 相同:输入 $0.75/百万 token、输出 $3.75/百万 token。但 Google 警告,模型为最大化性能可能消耗更多 token,尤其是高 effort 档位下,实际账单可能更高。想控制 token 用量的开发者可继续使用 3.7 Flash。发布后早期反馈出现一些争议。
「Infra」频道最新
- Perplexity Computer 在 DGX Spark 上实现全本地运行实机演示 — chrmanning · 2026-09-03
- llama.cpp 弃用 --chat-template-kwargs,推理保留默认开启 — Bulky-Priority6824 · 2026-09-03
- Agentic API:在 vLLM 前加有状态层,把编排从客户端搬进服务端 — techNmak · 2026-09-03
- Mitchell Hashimoto 公开 Superlogical 服务器内存优化实录 — sull · 2026-09-03
- Lily 跑分:M5 Max 上预填吞吐高 MLX-LM 23%,解码高 35% — perplexity_ai · 2026-09-03
- Perplexity 开源本地推理引擎 Lily,专为 Apple 芯片上的 Qwen3.6 打造 — perplexity_ai · 2026-09-03