vLLM 详解 MiniMax M3 在 AMD MI355X 上的调优:单卡吞吐提升至 4.45 倍

vllm_project · x · 2026-09-11

vLLM 团队联合 AMD 与 EmbeddedLLM 发布长文,复盘 MiniMax M3 在 Instinct MI355X 上从 day-0 跑通到持续优化的全过程,核心方法论是「跟着瓶颈走」。

关键成绩(SemiAnalysis InferenceFX 基准):

文中覆盖 MSA 稀疏注意力、MXFP8/FP4 量化、拓扑调优等可复用的优化经验,适合做下一个模型优化时参考。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →