2026-08-31
Nokia Bell Labs用2芯与4芯多核光纤做分布式LLM推理实验,把张量并行和流水线并行映射到空间信道;吞吐与时延数字在未取到的两页正文里。
GPU 集群把大模型切开做张量并行(tensor parallelism, TP)和流水线并行(pipeline parallelism, PP)时,激活要在设备之间来回搬。机柜内走 NVLink 还能把通信藏进计算,一旦跨机柜、跨机房,光纤传播时延会直接咬掉重叠窗口。光通信侧已经有人把 LLM 训练拉到 120 公里的现网 OTN 上做现场试验,也有人把 4 芯、16 芯多核光纤(multi-core fiber, MCF)当成数据中心加密度的介质。缺的是把「模型怎么切」和「光纤里有几根芯」当成同一件事:并行策略对上空间信道,并且用真实推理负载跑起来。
Nokia Bell Labs 联合住友电工在 SUM 2026 交了一篇两页短文,题目就写成 LLM 并行与空间并行的汇合。这是光子学顶会系列里的实验短文,不是系统顶会的 serving 论文。问题本身是真的:推理比训练更吃尾延迟,PP 的点对点流量和 TP 的 AllReduce 对时延的容忍度不一样,塞进同一对单模光纤里调度看不见空间隔离。
能核对的实验拓扑来自论文配图,不是摘要里的空话。四台节点,每台上 100GbE 网卡加 100G DR 光模块。链路同时给出三种介质:一对常规单模光纤(SMF,图里画了盘纤)、一根 2 芯 MCF、一根 4 芯 MCF。
任务切分也画在同一张图里:
设计选择很具体。一张 4 芯光纤用空间复用同时扛两路独立的分布式推理,LLM 侧的并行维度和光纤侧的芯对齐,而不是把所有 GPU 流量挤进一对 SMF。住友电工是 MCF 制造方,引用里有他们 2019 年的野外 MCF 试验床,以及 4 芯(包层 100 μm、涂层 160 μm,芯密度约 9.8 倍于单芯)、16 芯面向 1.6 Tbps 数据中心互联的 OFC 短文。软件并行的参照是 Megatron-LM 那套模型并行。
正文里用了哪个模型、多少参数、通信库是 NCCL 还是别的、光纤盘了多长、串扰怎么测,两页 PDF 被 IEEE 付费墙挡住,这里写不出。100G DR 的标称距离通常是几百米量级,图里的盘纤暗示他们在拉距离,实际跨度要以原文为准。
官方摘要只钉死两件事:在不同并行策略下考察光互联时延对 LLM 推理的影响;实验演示了基于 MCF 的分布式 LLM 推理。配图能确认的是双任务、三种光纤、TP 加 PP 的拓扑。
| 能确认的 | 来源 | 数字 |
| 会议与篇幅 | CrossRef | SUM 2026,第 1–2 页 |
| 节点与网卡 | 论文配图 | 4 节点,100GbE + 100G DR |
| MCF 规格 | 论文配图 | 2 芯与 4 芯,4 芯同时跑两路任务 |
| 并行映射 | 论文配图 | 节点内 TP,跨节点 PP |
| 吞吐 / 时延 / 加速比 | 未取到正文 | 论文未在摘要中给出 |
论文未给出与 InfiniBand、与纯 SMF、与仿真基线的对照表。这些数字在未取到的原文里。
从业者真正要判断的是:跨机房推理能不能把 PP 的点对点流量和 TP 的集合通信拆到不同纤芯上,用空间并行换布线密度和任务隔离。如果这条路走得通,MCF 就不再只是传输侧「一根顶四根」的缆,而是推理调度可以看见的空间信道。
这篇是渐进的物理层验证。4 节点、每节点最多两块 GPU,离生产推理集群差几个数量级,证明的是链路能跑,不是该这么部署。训练侧已经有 120 公里、千卡级的现场试验;推理侧开始有人用 MCF 真跑,而不是只做光层仿真。对做 serving 的人,短期用不上。对在看 scale-across 光互联和 MCF 布线的人,这是一张可以对着画的拓扑。
全文没拿到。时延曲线、模型规模、光纤长度、误码和对照基线全部未知,不能把传播帖里的距离数字写进结果。两页 SUM 短文容量有限,很难同时把并行策略扫描、芯间串扰和端到端 token 延迟写完整。100G DR 接口本身不是为公里级 campus 设计的,若正文没有额外的光层补偿或换模块说明,距离外推要谨慎。实验规模小,也没有看到与 NVLink 域内 TP、与常规以太网 PP 的公平对照。作者自述的局限在未取到的正文里。