Huawei's $τ$ Chip Was Supposed to Melt?
Tingbo He
cs.AR
2026-09-03
华为用 LogicFolding 把电路折成两层硅。麒麟 2026 晶体管密度升 55%,NPU 在同样 29 TOPS 下功耗降 66%、功率密度降 73%,芯片更凉而不是更烫。
3D 堆叠的第一反应是热。有源晶体管叠有源晶体管,单位面积功耗上去,结温顶满就降频。华为拿不到 EUV,几何微缩卡在大约 7 纳米,转去压信号走完关键路径的特征延迟 τ(读 tau,中文写作「韬」)。旗舰手段叫 LogicFolding:把摊在平面上的电路折成两层硅,长横线换成短垂直跳。
2026 年 5 月 ISCAS 上第一次公开时,现场最尖的质疑就是热。麒麟 2026 的实测把这个质疑反过来了。
Hybrid bonding 被当成晶圆级跨层器件步骤,不是封装。晶圆对晶圆对准、加压、退火,氧化层共价键合,铜垫熔成连续金属。麒麟 2026 在 40 纳米键合工具上做到 1.5 µm 键合间距、5000 万根垂直互连,其中 10% 到 15% 走信号。麒麟 2027 硅片已到 1 µm、超过 1 亿根。三年内目标对齐顶层金属 720 nm 间距、超过 2 亿根。选晶圆对晶圆,是因为光刻套准已经在纳米量级,芯片拾放的键合精度还在微米。
折的是 NPU、CPU、GPU、DSP 里最长最耗电的水平线。经验上,折叠路径的线长典型核减 20%,部分关键路径减到 70%。一块处理单元的时钟线减 28%,buffer 从 43600 降到 19000。
动态功耗约占手机日常负载的 90%。公式 P = αCV²f 里,先进节点的 C 由互连主导,不是门电容。办公类比:通勤烧掉的能量比坐在工位上思考多。大 AI 集群里超过 80% 的能量花在搬数据。折叠缩短通勤,C 线性下降;多出来的晶体管拿去复制并行单元、降电压,V² 二次下降。NPU 前代是 1 个大核加 2 个能效核,折叠后变成 4 个大核,70 TOPS 跑在 0.7 V,前代不到一半的算力却要 0.85 V。
对照平面前代麒麟 9030 Pro,同性能:
| 模块 | 同性能条件 | 功耗 | 其他 |
| NPU | 29 TOPS | -66% | 频率 -63%,电压 0.85 V→0.55 V,功率密度 -73% |
| GPU | 61 FPS | -58% | 电压低 200 mV |
| CPU 性能核 | HNX 同分数 | -41% | 频率 -9%,电压低 200 mV |
| DSP 一代 | 同工作量 | -25% | 面积 -40%,功率密度 +24% |
晶体管密度从约 1.55 亿/mm² 到 2.38 亿/mm²,升 55%,相当于过去三年几何微缩加起来的增量。满血时 NPU 到 70 TOPS,相对前代 +141%;GPU 帧率 +42%;CPU 的 HNX +18%。这些档位功率密度会超过平面前代。麒麟 2027 的 DSP 功耗再降 47%,功率密度落到平面原片之下。CPU 性能核今年回到 3.1 GHz,路线图写到 5 GHz 以上。
对做端侧推理的人,数字最硬的是 NPU:同样 29 TOPS,功耗砍掉三分之二,电压掉到 0.55 V。这是系统-工艺协同(STCO),不是新晶体管。拿不到 EUV 的厂商在用时间换空间;能拿到 EUV 的厂商如果互连已经是功耗大头,这条路同样可能有用。
凉不是折叠的物理必然。满血模式功率密度照样会超。麒麟之所以凉,是因为他们选择把时间余量花在降压上。τ 管的是时间,能量是另一门功课。
作者承认 τ 是时间定律不是能量定律。折叠系统可以跑更快、烧更多,并不违反 τ。CPU 大核几乎串行,折叠只换来 9% 的频率下降,二次电压杠杆用不上,后面三到五年的活还在前面。DSP 第一代面积缩得比功耗快,功率密度反升 24%,热问题在这个块上并没有一代解决。
这篇是华为工程师的预印本,对照是自家 9030 Pro,没有第三方复测,也没有和台积电、三星同类 3D 逻辑堆叠的并排。键合在 40 纳米工具上做到 1.5 µm,和电路折叠本身的增益如何拆开,文中没有消融。结温、热点分布只有定性描述,没有给出结温数字。宣传口径很满,数字需要当公司自报来读。