AWS实测G7 Blackwell实例:30B MoE推理比G5/G6更省更快
AWS ML Blog · rss · 2026-09-09
AWS ML Blog 用 SageMaker AI 推理推荐功能,对两个 30B 级 MoE 模型在三代 GPU 实例上做基准测试,展示新一代 G7(RTX PRO 4500 Blackwell)实例的收益:
- 用例一:Qwen3-Coder-30B(FP8,编码助手场景),在 ml.g5/g6/g7.12xlarge 上用 DJL LMI 28.0 容器做同条件对比——G5/G6 各 4 卡共 96GB 显存,G7 仅 2 卡共 64GB。
- 用例二:NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4(企业助手场景),用推理推荐功能在 G6/G6e/G7 中自动选型(vLLM 服务)。
- 关键结论:MoE 解码受显存带宽约束;NVFP4 4-bit 量化只有 G7 的 Blackwell Tensor Core 提供原生硬件加速,G5/G6 只能无加速运行,G7 因此在 MoE 部署上具结构性优势。
- G7 目前仅在美东(俄亥俄)与美西(俄勒冈)区域可用。
「Infra」频道最新
- 一年半攒下 RTX Pro 6000、双 DGX Spark:本地 AI 算力真实体验 — EAccelerate_42 · 2026-09-09
- Perplexity CEO:推理已大规模迁至 NVLink Blackwell,下一代将上 Vera Rubin — AravSrinivas · 2026-09-09
- 台积电 2030 启用 High-NA EUV,三星 2028 目标 DRAM 应用 — BenBajarin · 2026-09-09
- 分析师称企业云 AI 开销或达本地部署方案的 10-20 倍 — DavidLinthicum · 2026-09-09
- Anthropic 官方指南:三招降低 Claude 成本不损性能 — ClaudeDevs · 2026-09-09
- DisposAI 开源:让本地模型互相当工具,8GB 显存跑通文生图转 3D — Agitated_Complex_628 · 2026-09-09