SemiAnalysis 深文:MoE 模型如何映射到推理硬件的算力与数据搬运
zephyr_z9 · x · 2026-09-22
SemiAnalysis 发布长文《Computation and Data Movement for Inference》(Tanj Bennett,付费),系统讲解 MoE 前沿模型在推理硬件上的结构、数据流与高效 serving。要点:
- MoE 不只是增加参数量,而是改变了每个 token 激活哪些张量、哪些数据必须就近放置、哪些传输依赖高本地带宽、哪些可容忍弱网络连接,以及内存搬运、存储与调度如何影响有效吞吐。
- 推理运行在由编排层(如 NVIDIA Dynamo、Mooncake 或自研调度器)协调的集群中,与 vLLM、SQlang 等推理服务器紧密配合。
- 文章从服务整体出发,以「turn」(请求-回答)为基本单位,覆盖客户端应用拦截 AI 指令执行操作、AI 自身联网搜索等产生的多轮请求,以及 KV cache 对会话上下文的维护机制。
「Infra」频道最新
- 史上最大规模发布之一却保持高可用,平台团队获业内称赞 — hardimanjames · 2026-09-22
- Agentic AI 拉动 CPU 需求:CPU:GPU 配比没有统一标准 — BenBajarin · 2026-09-22
- Ben Bajarin:智能体时代数据中心 CPU:GPU 配比之争重燃 — BenBajarin · 2026-09-22
- AMD 发布 EPYC Venice 白皮书:SPEC 整数性能 2.24 倍于 Vera — ryanshrout · 2026-09-22
- python-build-standalone 为 CPython 3.12+ 启用全量 LTO 提升运行性能 — charliermarsh · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22