Measuring the environmental impact of delivering AI at Google Scale
Cooper Elsworth, Keguo Huang, David Patterson, Ian Schneider, Robert Sedivy, Savannah Goodman, Ben Townsend, Parthasarathy Ranganathan, Jeff Dean, Amin Vahdat, Ben Gomes, James Manyika
cs.AI
2025-08-22
Google用生产遥测量Gemini中位文本提问:0.24 Wh、0.03 gCO2e、0.26 mL水。一年内能耗降33倍、碳排降44倍,比多数公开估算低一到两个数量级。
公开估算一份对话提问要 0.3 到 3 瓦时,水耗从 0.3 毫升到 45 毫升,差一个数量级。根子是测量边界对不齐:多数工作只量活跃 GPU,实验室还常把 batch 钉在 1。生产系统还要付主机 CPU、为延迟预留的空闲容量,以及机房 PUE。Google 用 Gemini Apps 的生产遥测,给出第一份大厂全栈数字。
对照文献里,De Vries 按 A100 和 GPT-3.5 估过约 3 Wh,Epoch.AI 按 GPT-4o 和 H100 估约 0.3 Wh,Altman 2025 年报过 0.34 Wh 和约 0.3 mL 水,但没给测量边界。Luccioni 等对 BLOOM 的实测含 GPU/CPU/DRAM,约 4 Wh/提问。同一 Llama 3.1 70B,不同基准能差 6 倍。
功能单元是一台服务用 AI 计算机:加速器托盘加主机托盘。能耗拆成四块:活跃加速器(含 prefill、decode 和机内互联)、活跃 CPU 与 DRAM、为空闲和故障切换预留的机器、用校园级 PUE 计入的机房开销。
遥测按任务 ID 映射到机器、读电源,再按「该模型总能耗 / 提问量」排序,取服务第 50 百分位提问的那个模型。分布右偏,长输出会把均值拉歪,所以用中位数。碳走市场法电网因子(2024 年为 94 gCO2e/kWh)再摊上加速器和主机的 Scope 1+3;水用耗水型 WUE 1.15 L/kWh,只计蒸发。对照的「现有口径」只留活跃加速器,并抽样能耗最低的 10% 机房。外网、终端、训练不进边界。
2025 年 5 月中位 Gemini Apps 文本提问:
| 口径 | 能耗 | 排放 | 水 |
| 现有(加速器+高效机房) | 0.10 Wh | 0.02 gCO2e | 0.12 mL |
| 全栈 | 0.24 Wh | 0.03 gCO2e | 0.26 mL |
全栈里加速器 0.14 Wh(58%),CPU/DRAM 0.06(25%),空闲和开销各 0.02。相对只量加速器大约要乘 1.72,不是文献里常用的翻倍。0.24 Wh 相当于看约 9 秒 100 瓦电视;0.26 mL 约五滴水。Mistral 公开的 45 mL、Li 等人的 10-50 mL,都高一到两个数量级。
2024 年 5 月到 2025 年 5 月,中位提问能耗降 33 倍(模型改进约 23 倍、利用率 1.4 倍),市场法排放强度再降 1.4 倍,Scope 1+3 降 36 倍,合计碳足迹 44 倍。机房平均 PUE 1.09。2023 年位置法 366 gCO2e/kWh、购清洁能源抵 231、市场法净 135;2024 年位置法 345、抵 251、市场法 94,排放强度大约再降 30%。效率侧点了 MoE(只激活一小撮专家)、量化训练 AQT、投机解码、蒸馏到 Flash/Flash-Lite,以及相对第一代公开 TPU 能效高约 30 倍的 Ironwood。
只报 GPU 焦耳会系统性低估生产能耗约 2.4 倍。能对上号的数字来自批处理、投机解码、prefill/decode 分离、蒸馏到 Flash 级小模型和自研 TPU,不是 batch=1 的实验室跑分。空闲容量只占约 8% 到 10%,不是「一半机器在空转」。想横向比模型,先对齐测量边界。
数字无法外部复核。中位数切掉了长思维链和低利用率模型。市场法把购绿电算进去,位置法会高很多(2024 年位置法 345 gCO2e/kWh,市场法 94)。产品切到蒸馏小模型,33 倍里有多少是「同一模型变好」、多少是「换成更小的模型」,论文没拆开。图像、视频、深度思考都不在口径里,训练另账,不在这张账单里。