微软公开 Maia 200 架构:砍掉缓存层级,软件定义数据流

beenwrekt · x · 2026-08-27

微软公开了第二代推理加速器 Maia 200 的详细架构论文(arXiv:2608.24664),已在 Azure 机群中投产,面向万亿参数前沿模型的推理。

核心设计:没有缓存层级。 论文论证 LLM 推理大多是 data-oblivious 的——编译器几乎能在模型运行前规划好所有内存访问,而缓存是"猜测下一个数据"的硬件。当调度已知时,猜测硬件只会增加成本:论文指出 tag 阵列与重映射逻辑带来 30-35% 的面积和能耗开销,外加 10-15% 的访问延迟。

Maia 200 用编排取代猜测:称为 SDLA(Software Defined Locally Accessed Dataflow)的架构把所有 scratchpad、DMA 引擎、信号量和计算单元暴露给软件,C++ 控制程序跑在数据通路之前。规格上,芯片在 750W TDP 内实现 10145 TFLOP/s FP4 与 5072 TFLOP/s FP8,HBM 带宽 7TB/s。这种从线程中心到数据搬运中心的转变,带来了显著的成本与能耗节约。

所属事件:微软公开Maia 200推理加速器架构:取消缓存层级(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →