4芯光纤同时跑两路LLM推理,张量与流水并行分芯承载

2026-08-31

Nokia Bell Labs用2芯与4芯多核光纤做分布式LLM推理实验,把张量并行和流水线并行映射到空间信道;吞吐与时延数字在未取到的两页正文里。

这篇在解决什么

GPU 集群把大模型切开做张量并行(tensor parallelism, TP)和流水线并行(pipeline parallelism, PP)时,激活要在设备之间来回搬。机柜内走 NVLink 还能把通信藏进计算,一旦跨机柜、跨机房,光纤传播时延会直接咬掉重叠窗口。光通信侧已经有人把 LLM 训练拉到 120 公里的现网 OTN 上做现场试验,也有人把 4 芯、16 芯多核光纤(multi-core fiber, MCF)当成数据中心加密度的介质。缺的是把「模型怎么切」和「光纤里有几根芯」当成同一件事:并行策略对上空间信道,并且用真实推理负载跑起来。

Nokia Bell Labs 联合住友电工在 SUM 2026 交了一篇两页短文,题目就写成 LLM 并行与空间并行的汇合。这是光子学顶会系列里的实验短文,不是系统顶会的 serving 论文。问题本身是真的:推理比训练更吃尾延迟,PP 的点对点流量和 TP 的 AllReduce 对时延的容忍度不一样,塞进同一对单模光纤里调度看不见空间隔离。

方法

能核对的实验拓扑来自论文配图,不是摘要里的空话。四台节点,每台上 100GbE 网卡加 100G DR 光模块。链路同时给出三种介质:一对常规单模光纤(SMF,图里画了盘纤)、一根 2 芯 MCF、一根 4 芯 MCF。

任务切分也画在同一张图里:

设计选择很具体。一张 4 芯光纤用空间复用同时扛两路独立的分布式推理,LLM 侧的并行维度和光纤侧的芯对齐,而不是把所有 GPU 流量挤进一对 SMF。住友电工是 MCF 制造方,引用里有他们 2019 年的野外 MCF 试验床,以及 4 芯(包层 100 μm、涂层 160 μm,芯密度约 9.8 倍于单芯)、16 芯面向 1.6 Tbps 数据中心互联的 OFC 短文。软件并行的参照是 Megatron-LM 那套模型并行。

正文里用了哪个模型、多少参数、通信库是 NCCL 还是别的、光纤盘了多长、串扰怎么测,两页 PDF 被 IEEE 付费墙挡住,这里写不出。100G DR 的标称距离通常是几百米量级,图里的盘纤暗示他们在拉距离,实际跨度要以原文为准。

结果

官方摘要只钉死两件事:在不同并行策略下考察光互联时延对 LLM 推理的影响;实验演示了基于 MCF 的分布式 LLM 推理。配图能确认的是双任务、三种光纤、TP 加 PP 的拓扑。

能确认的来源数字
会议与篇幅CrossRefSUM 2026,第 1–2 页
节点与网卡论文配图4 节点,100GbE + 100G DR
MCF 规格论文配图2 芯与 4 芯,4 芯同时跑两路任务
并行映射论文配图节点内 TP,跨节点 PP
吞吐 / 时延 / 加速比未取到正文论文未在摘要中给出

论文未给出与 InfiniBand、与纯 SMF、与仿真基线的对照表。这些数字在未取到的原文里。

为什么重要

从业者真正要判断的是:跨机房推理能不能把 PP 的点对点流量和 TP 的集合通信拆到不同纤芯上,用空间并行换布线密度和任务隔离。如果这条路走得通,MCF 就不再只是传输侧「一根顶四根」的缆,而是推理调度可以看见的空间信道。

这篇是渐进的物理层验证。4 节点、每节点最多两块 GPU,离生产推理集群差几个数量级,证明的是链路能跑,不是该这么部署。训练侧已经有 120 公里、千卡级的现场试验;推理侧开始有人用 MCF 真跑,而不是只做光层仿真。对做 serving 的人,短期用不上。对在看 scale-across 光互联和 MCF 布线的人,这是一张可以对着画的拓扑。

局限与存疑

全文没拿到。时延曲线、模型规模、光纤长度、误码和对照基线全部未知,不能把传播帖里的距离数字写进结果。两页 SUM 短文容量有限,很难同时把并行策略扫描、芯间串扰和端到端 token 延迟写完整。100G DR 接口本身不是为公里级 campus 设计的,若正文没有额外的光层补偿或换模块说明,距离外推要谨慎。实验规模小,也没有看到与 NVLink 域内 TP、与常规以太网 PP 的公平对照。作者自述的局限在未取到的正文里。

术语

原文与代码

社区讨论

全部论文解读