MiniMax 称 AMD MI355X 在模型 serving 上已接近 B200
hongyangzh · x · 2026-07-24
MiniMax 说 AMD MI355X 在 serving 上已接近 Nvidia B200
这条转发自 MiniMax 的技术帖称,AMD MI355X 在 MiniMax-M3 的推理服务场景里,已经接近 Nvidia B200 的表现。
MiniMax 还发布了两篇技术博客,介绍其 ATOM + ATOMesh 的全栈协同优化,目标对象是一个 428B 的稀疏 MoE 多模态基座模型。
主要技术点
- 使用 EAGLE3 speculative decoding 降低生成延迟
- 引入 MSA-aligned Page-16 KV cache,支持 100 万 超长上下文
- 采用 逐层 FP8 量化,尽量避免视觉模块和 MoE 部分精度下降
- 通过 分布式 P/D 分离架构 支撑大规模集群
整体看,这条信息的价值在于:它展示了 AMD GPU 在真实大模型 serving 里正逐步逼近 Nvidia 的工程实践。
所属事件:MiniMax称AMD MI355X推理性能已接近英伟达B200(2 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11