Thermal Tuning Overhead in Wafer-Scale Optical Interconnects for LLM MoE Training: A Cross-Layer Analysis and Ferroelectric-Based Mitigation
Seongwon Yoon, Pin-Jun Chen, Shimeng Yu
cs.AR
2026-08-25
佐治亚理工跨层仿真显示,MoE 训练功耗脉冲让微环热调谐每轮 stall 约 47 毫秒;铁电电光调谐去掉 stall 后,四层代理里三套模型分别快 2.7×、3.8×、3.3×。
MoE 每个 block 都要做两次 all-to-all:token 先派到专家所在的加速器,算完再收回来。论文测下来,这段通信能占一次 iteration 的三分之一到一半以上,而且路由是偏斜的,少数专家反复被选中,热和流量都会扎堆。
晶圆级硅光互连用密集波分复用(DWDM,一根波导同时跑多个波长)把带宽堆上去,目标对齐 Tesla Dojo 量级的 1.5 TB/s 芯到芯带宽。微环谐振器(MRR)卡住了有效吞吐。它体积小于 50 μm、天然适合挑波长,但允许的温度漂移不到 1 K;Mach-Zehnder 和电吸收调制器能扛 50 K 以上。常规做法靠热光调谐把谐振对准目标波长,调一次就要微秒到毫秒,还得持续闭环。GPU 算力脉冲把热热点送进光子层,谐振漂走,链路就得停下来重新对准。
佐治亚理工把工作负载、封装热、器件和包级网络串成一条链,stall 时长从热仿真推出来,不靠事先假定。
架构是 300 mm 晶圆:中心 4×4 GPU,外围 16 个 HBM reticle。每颗芯片垂直叠 GPU、电芯片(EIC)和光子芯片(PIC),再键合到氮化硅波导 interposer。单波长 32 Gb/s,每根波导 32 个波长,12 根波导合计 12.288 Tb/s。片上不做全光交换,中间节点用光-电-光中继再生。
热模型的边界条件和材料参数全部取自 Coenen 等人对 2.5D/3D 共封装光学的标定:XPU 峰值 700 W,冷却只走顶侧微通道冷板。功率曲线来自 FlexFlow 任务图,不是实测功率:attention 和 expert GEMM 按满功耗 700 W,gate 按 40%(280 W),add-and-norm 按 20%(140 W),all-to-all 没有计算核,按板级空闲 12%(84 W)。单次 all-to-all 时长按 350 ms 填进时间轴。
温度轨迹还不够。他们用四步把 T(t) 变成通信 stall:硅微环热光系数 80 pm/K 算出谐振漂移;控制器最大跟踪速率 0.0625 K/ms;残差超过谐振半高全宽的 10%(19.4 pm,大约 1 dB 插损)的区间记为 stall。对照方案是铌酸锂波导加 HZO 铁电栅,外电场通过 Pockels 效应改折射率,极化翻转后保持,不必持续加热。器件级开关约 5.4 ns,10 ns 饱和;HZO 在 90°C 仍能保住 85% 以上的极化。
计算侧在 H100 上刻画,再映射到假想晶圆系统:Mixtral 8×7B 用 256 GPU、16 片晶圆,Qwen-MoE 14.3B 用 512 GPU、32 片,LLaMA-MoE 6.7B 用 128 GPU、8 片。
PIC 层最大降温速率 Mixtral 和 Qwen 约 0.18 K/ms,LLaMA-MoE 约 0.21 K/ms,都远超热光环 0.0625 K/ms 的跟踪能力。每个 iteration 的热峰都会超预算。稳态 stall 均值如下,注入网络仿真后相对无 stall 基线:
| 模型 | 专家并行度 | 稳态 stall | iteration 时间 |
| Mixtral 8×7B | EP 8 | 48.7 ms | 2.7× |
| Qwen-MoE 14.3B | EP 64 | 46.8 ms | 3.8× |
| LLaMA-MoE 6.7B | EP 16 | 47.4 ms | 3.3× |
慢多少跟 EP 度数走,不跟 stall 绝对值走。Qwen 的 stall 最短,专家散得最开,每卡通信份额更大,所以最疼。延迟低于约 10 ms 时几乎看不出,过了这个点才沿通信关键路径放大。
无 stall 时这套晶圆光互连并不稳赢电气基线。四层代理、每链路 400 Gbps 下,LLaMA-MoE 的 422.5 ms 快过电气 fat-tree 的 732.0 ms 和 flat NVLink 的 486.9 ms;Mixtral 的 1089.5 ms 反而慢于 flat 的 843.9 ms。2.7× 到 3.8× 的膨胀来自拿掉热 stall,不是来自光互连对电气的无条件优势。
全层数任务图上,stall 均值涨到 Mixtral 173.9 ms、Qwen 68.3 ms、LLaMA-MoE 96.9 ms。包级网络仿真在这个规模跑不完,2.7 / 3.8 / 3.3 这组倍数仍是四层代理结果。扫过品质因数 Q、失谐预算和跟踪速率之后,报告用的 stall 均值落在扫描区间低端,倍数更接近保守估计。
铁电方案按可忽略延迟建模。按 stall 窗口计数,每个 iteration 大约要切 3.0 到 5.9 次;100 万次 iteration 约 300 万到 600 万次翻转,仍低于 HZO 在 125°C 下报道的 1000 万次耐久。
给光互连和 MoE 系统一个定量警告:把 DWDM 标称带宽堆到 1 TB/s 以上,挡不住约 47 ms 的热对准开销。训练里算力脉冲和通信突发叠在一起,热光环的跟踪带宽不够用。铁电非易失调谐把问题从毫秒打到纳秒,前提是器件能在 GPU 邻域温度下扛住百万到千万次翻转。
这是方向清楚的硬件建议,还不是可落地的链路产品。Lightmatter、Celestial AI、TSMC COUPE 如果继续用热光微环,在 MoE 这种算力-通信交替的负载上,有效吞吐会被调谐 latency 卡住。对现在就在跑 Mixtral / Qwen-MoE 的训练集群,这篇帮不上现网调参;它点名的是下一代 scale-up 光封装该把调谐 latency 当成一等约束。
网络仿真只用了四层代理(Mixtral / LLaMA 实际 32 层,Qwen 24 层)。全规模包级仿真 50 分钟到 4.7 小时都没跑完,端到端倍数外推没有闭合。功率是 roofline 假设,论文写明没有这份负载的实测 GPU 功率 trace。all-to-all 的 350 ms 是事先给定的,不是光网络自己算出来的。
铁电部分停在 TCAD 加 Lumerical 的器件验证,加上引用的 HZO 开关和耐久数据,没有做成完整收发链路再塞进同一套网络仿真。无 stall 时晶圆方案对 Mixtral 和 Qwen 并不快过 flat all-to-all。大倍数完全来自拿掉自己引入的热 stall,对照电气基线时要把这句话一起读。
H100 上的算力画像直接搬到尚未存在的晶圆级 3D 堆叠上,热时间常数和功耗密度都可能对不上。物理常数仍是文献单点,不是这块封装上测出来的。MixNet 对照只覆盖 EP=8 的 Mixtral,Qwen 和 LLaMA-MoE 的更高 EP 不在其公开实现范围内。