MiniMax-H3 跑 8×H200:无损加速 1.95 倍,最高 6.24 倍
ying11231 · x · 2026-08-28
LMSys 发布博文,展示了在 8 张 H200 上运行 MiniMax-H3 的性能优化成果。在固定提示词、分辨率等条件下,通过融合内核、Cache-DiT 步骤复用和 SubBlock 稀疏注意力三种技术组合,实现了不同程度的加速:
- 密集无损路径:比 Diffusers 快 1.85–1.95 倍,无近似损失。
- 极致速度模式:结合步骤复用与稀疏注意力,最高加速 6.24 倍,但 SSIM 指标有所下降。
- 预设配置:Conservative 模式在 0.90–0.98 SSIM 下加速 2.99 倍;Speed 模式在 0.77–0.92 SSIM 下加速 4.90–5.93 倍。
该工作由 LMSys、蚂蚁集团、Nvidia 及 Cache-DiT 团队合作完成。
「Infra」频道最新
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28
- GMI Router 实测:三类任务自动分派三家模型,单次省 0.02-0.03 美元 — Shruti_0810 · 2026-08-28
- Architect Labs 称 AI 两周设计出芯片 Redwood,能效比号称超 NVIDIA — mark_k · 2026-08-28
- GMI Router 推出 KV 缓存感知模型路由 — anthara_ai · 2026-08-28
- 暂停并恢复云 GPU:不丢失 ComfyUI 环境的省钱技巧 — deployonaquanode · 2026-08-28
- 手把手:用 Terraform 与 GitHub Actions 将 Agent 部署至 AWS ECS — kmeanskaran · 2026-08-28