LLM每token能耗或已低于人脑

jd_pressman · x · 2026-07-21

这条帖在讨论:**LLM 推理按每个 token 计算,能耗可能已经低于人类“推理”**,至少在短上下文输出上如此。 - 图中给出一个粗略估算:基于 Epoch 的约 **48,000 个 NVIDIA NVL72 机架**、约 **5.8 GW** 机架功率,按输出能力折算,得到大致: - **短上下文:0.3 J/token** - **中等上下文:1 J/token** - **长上下文:12 J/token** - 作者提醒,机房冷却和供电损耗会让这些数字更高一些,但短输出场景下的结论大体不变。 - 对比人脑时,按帖子里的 **12W** 和 **3–4 tokens/s** 估算,约为 **3–4 J/token**;按更常见的 **20W 全脑预算** 估算,则约为 **5–7 J/token**。 - 因此作者认为:现代批处理推理在**短上下文**场景下,已经可能比“人类推理”更省能;但**超长上下文**推理仍略差。 - 另外,图里还补充了一个重要限定:**Kimi K2.6** 虽然有 **1 万亿**存储参数,但每个 token 实际只激活 **320 亿**参数,不是引用里假设的约 **3600 亿**活动参数。

所属事件:Epoch AI:单次 LLM 查询能耗已低于人脑推理(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →