微软 Maia 200 架构公开:废除缓存层级改用软件定义
thoefler · x · 2026-08-27
微软发布了第二代推理加速器 Maia 200 的详细架构,该芯片专为万亿参数前沿模型设计并已在 Azure 部署。其最具指导意义的设计决策是取消了缓存层级。理由是 LLM 推理大多是数据无关的,编译器可以在模型运行前规划几乎所有的内存访问,缓存作为猜测硬件只会增加成本和延迟。论文指出缓存带来了 30-35% 的面积和能耗开销。Maia 200 采用软件定义本地访问数据流 (SDLA) 架构,将所有暂存器、DMA 引擎、信号量和计算单元暴露给软件,用 C++ 控制程序提前运行以编排数据流。
所属事件:微软公开Maia 200推理加速器架构:取消缓存层级(3 条相关)→
「Infra」频道最新
- 一台 DGX Spark 能同时服务多少人?社区征集真实数据 — edge_compute_user · 2026-08-27
- Unsloth 被请求用 UD 3.0 重量化 Qwen 旧版模型 — Fancy-Snow7 · 2026-08-27
- QNX 携手 Hailo 做边缘 Physical AI:性能一致性提升 14 倍 — pdamodaran · 2026-08-27
- 美企算力优势达 15-20 倍,但在特定威胁下或无效 — ohlennart · 2026-08-27
- Hark 宣布与 NVIDIA 合作,获千兆级算力支持多模态系统 — adcock_brett · 2026-08-27
- Minimax H3 本地部署实测:5秒片段需4分钟 — thevictor390 · 2026-08-27