微软公开 Maia 200 架构:砍掉缓存层级,软件定义数据流
beenwrekt · x · 2026-08-27
微软公开了第二代推理加速器 Maia 200 的详细架构论文(arXiv:2608.24664),已在 Azure 机群中投产,面向万亿参数前沿模型的推理。
核心设计:没有缓存层级。 论文论证 LLM 推理大多是 data-oblivious 的——编译器几乎能在模型运行前规划好所有内存访问,而缓存是"猜测下一个数据"的硬件。当调度已知时,猜测硬件只会增加成本:论文指出 tag 阵列与重映射逻辑带来 30-35% 的面积和能耗开销,外加 10-15% 的访问延迟。
Maia 200 用编排取代猜测:称为 SDLA(Software Defined Locally Accessed Dataflow)的架构把所有 scratchpad、DMA 引擎、信号量和计算单元暴露给软件,C++ 控制程序跑在数据通路之前。规格上,芯片在 750W TDP 内实现 10145 TFLOP/s FP4 与 5072 TFLOP/s FP8,HBM 带宽 7TB/s。这种从线程中心到数据搬运中心的转变,带来了显著的成本与能耗节约。
所属事件:微软公开Maia 200推理加速器架构:取消缓存层级(3 条相关)→
「Infra」频道最新
- 一台 DGX Spark 能同时服务多少人?社区征集真实数据 — edge_compute_user · 2026-08-27
- Unsloth 被请求用 UD 3.0 重量化 Qwen 旧版模型 — Fancy-Snow7 · 2026-08-27
- QNX 携手 Hailo 做边缘 Physical AI:性能一致性提升 14 倍 — pdamodaran · 2026-08-27
- 美企算力优势达 15-20 倍,但在特定威胁下或无效 — ohlennart · 2026-08-27
- Hark 宣布与 NVIDIA 合作,获千兆级算力支持多模态系统 — adcock_brett · 2026-08-27
- Minimax H3 本地部署实测:5秒片段需4分钟 — thevictor390 · 2026-08-27