微软 Maia 200 架构公开:废除缓存层级改用软件定义

thoefler · x · 2026-08-27

微软发布了第二代推理加速器 Maia 200 的详细架构,该芯片专为万亿参数前沿模型设计并已在 Azure 部署。其最具指导意义的设计决策是取消了缓存层级。理由是 LLM 推理大多是数据无关的,编译器可以在模型运行前规划几乎所有的内存访问,缓存作为猜测硬件只会增加成本和延迟。论文指出缓存带来了 30-35% 的面积和能耗开销。Maia 200 采用软件定义本地访问数据流 (SDLA) 架构,将所有暂存器、DMA 引擎、信号量和计算单元暴露给软件,用 C++ 控制程序提前运行以编排数据流。

所属事件:微软公开Maia 200推理加速器架构:取消缓存层级(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →