vLLM 详解 MiniMax M3 在 AMD MI355X 上的调优:单卡吞吐提升至 4.45 倍
vllm_project · x · 2026-09-11
vLLM 团队联合 AMD 与 EmbeddedLLM 发布长文,复盘 MiniMax M3 在 Instinct MI355X 上从 day-0 跑通到持续优化的全过程,核心方法论是「跟着瓶颈走」。
关键成绩(SemiAnalysis InferenceFX 基准):
- 并发 32 下 MXFP8 标准服务从 109.1 提升至 342.4 output tokens/s/GPU(3.14×),TTFT 从 1.46s 降至 0.67s
- 并发 128 下 TP4/EP1 路径提升至 623.7(2.09×)
- MXFP4 配合 TP2/EP1 达到 943.5 tokens/s/GPU,为最初成绩的 4.45 倍
- 加入 EAGLE3 投机解码后达 682.4;P/D 分离部署在并发 512 下总吞吐达 6,370.5 tokens/s/GPU
文中覆盖 MSA 稀疏注意力、MXFP8/FP4 量化、拓扑调优等可复用的优化经验,适合做下一个模型优化时参考。
「Infra」频道最新
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11
- 预算友好多 GPU 本地 LLM 搭建实录:写给新人的入门指南 — lblblllb · 2026-09-11
- 腾讯参投的燧原科技上海上市首日暴涨 179%,募资 9.1 亿美元 — pstAsiatech · 2026-09-11
- Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开 — whiteh4cker · 2026-09-11
- Qdrant 宣布三场免费社区活动:4 小时向量技术长直播压轴 — qdrant_engine · 2026-09-11
- 国内 B300 现货喊到 1600 万一台,3 倍溢价把国产卡推成推理最优解 — aigclink · 2026-09-11