谷歌 AI 基建掌门人:10 万加速器规模下,FLOPS 只是虚荣指标
Training Data (Sequoia) · rss · 2026-10-06
红杉播客《Training Data》专访谷歌 AI 基础设施首席技术官 Amin Vahdat,谈前沿 AI 的物理与经济学。
- Goodput 而非 FLOPS:在 10 万加速器规模下,故障每小时发生多次,他认为是时候抛弃 FLOPS 这个虚荣指标,改用衡量真实故障下有效产出的 goodput。
- TPU 路线:回顾 2013 年的反共识押注,首次拆分为 8i(推理)与 8t(训练)的决策逻辑,以及 TPU 核心原语自 v1 以来未变的设计哲学。
- 与 DeepMind 联合设计:双方在同一间办公室共事,可在流片前中途修改芯片架构。
- Agent 改变数据中心形态:长时程智能体让 CPU 与存储需求随加速器一起暴涨。
- 网络与电力:光路交换机可在毫秒内把光路切换到备用机架;电力是最大瓶颈,谷歌宁等电网也不自建吉瓦级电站。
- 还讨论了每六个月翻倍的 token 容量、轨道数据中心,以及 2036 年的多兆瓦机架愿景。
「Infra」频道最新
- Drax 拟烧 490 万吨木材供电数据中心,排放近两倍于盖特威克航班 — nordicinst · 2026-10-06
- 数据中心商 DayOne 递交美股 IPO:上半年营收 5.12 亿美元,净亏扩大至 7720 万 — zephyr_z9 · 2026-10-06
- Strata 宣称 6GB 显存即可实现 5090 级推理性能 — lxfater · 2026-10-06
- ComfyUI 跑 Flux:13 款 GPU 实测对比基准发布 — Ok_Contribution8157 · 2026-10-06
- ODS 一键部署本地 AI:自动检测硬件、装模型、带 Agent 与插件 — Teknium · 2026-10-06
- PlanetScale 工程师长文:从手跑 Postgres 讲透 Kubernetes 反馈循环 — bibryam · 2026-10-06