MiniMax 称 MI355X 服务性能已接近 B200,覆盖 428B 多模态模型
salykova_ · x · 2026-07-23
MiniMax 表示,正与更多硬件厂商合作,共同优化推理性能,并强调开放生态。引用信息里还提到,AMD MI355X 在 MiniMax-M3 的服务场景下,性能已经接近 Nvidia B200。
这条帖子指向两篇技术博客,核心是 MiniMax 在其 428B 参数的 MSA sparse MoE 多模态基座模型 上做的全栈优化,包括:
- 用 EAGLE3 speculative decoding 降低生成延迟
- 采用 MSA 对齐的 Page-16 KV cache,支持 100 万长度上下文
- 使用 分层 FP8 量化,尽量避免视觉/MoE 模块精度下降
- 通过 分布式 P/D 分离架构 适配大规模集群
整体来看,这是一条关于推理加速、长上下文缓存和软硬件协同的基础设施动态。
「Infra」频道最新
- Celeris 组建新实验室,押注微秒级响应的 LLM — timshi_ai · 2026-07-23
- Reddit 讨论:如何在 AI agent 跑飞前拦住账单 — Designer_Power3691 · 2026-07-23
- 一组 LLM 缓存管理资源,覆盖 KV cache 与推理解码优化 — gaganghotra_ · 2026-07-23
- RunPod 用户获得一个可提醒并自动领取 pod 的 Chrome 扩展 — Particular-Repair895 · 2026-07-23
- Aurora 发布开源 Go 网关,主打 LLM 路由与安全防护 — Select-Medicine-9310 · 2026-07-23
- 押注基础设施支出回落的投资者,可能看错了 AI 周期 — cgarciae88 · 2026-07-23