LLM每token能耗或已低于人脑
jd_pressman · x · 2026-07-21
这条帖在讨论:LLM 推理按每个 token 计算,能耗可能已经低于人类“推理”,至少在短上下文输出上如此。
- 图中给出一个粗略估算:基于 Epoch 的约 48,000 个 NVIDIA NVL72 机架、约 5.8 GW 机架功率,按输出能力折算,得到大致:
- 短上下文:0.3 J/token
- 中等上下文:1 J/token
- 长上下文:12 J/token
- 作者提醒,机房冷却和供电损耗会让这些数字更高一些,但短输出场景下的结论大体不变。
- 对比人脑时,按帖子里的 12W 和 3–4 tokens/s 估算,约为 3–4 J/token;按更常见的 20W 全脑预算 估算,则约为 5–7 J/token。
- 因此作者认为:现代批处理推理在短上下文场景下,已经可能比“人类推理”更省能;但超长上下文推理仍略差。
- 另外,图里还补充了一个重要限定:Kimi K2.6 虽然有 1 万亿存储参数,但每个 token 实际只激活 320 亿参数,不是引用里假设的约 3600 亿活动参数。
所属事件:Epoch AI:单次 LLM 查询能耗已低于人脑推理(2 条相关)→
「Infra」频道最新
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11
- 英伟达已成主流 Robotaxi 栈核心:训练仿真车载计算全覆盖 — pdamodaran · 2026-09-11
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11