SageMaker 并发压测教程:Nemotron-3 Nano 30B 饱和点定位
AWS ML Blog · rss · 2026-09-22
- 问题:生成式 AI 端点选型若靠手工试错,多配实例浪费 GPU,少配则排队延迟飙升。SageMaker AI Inference Recommendations 内置 concurrency sweep(并发扫描),自动递增并发(如 64→256→1024)测吞吐与延迟,定位饱和点。
- 部署:以原生 vLLM 容器在 ml.g7e.2xlarge(Blackwell GPU)上部署 NVIDIA Nemotron-3 Nano 30B(MoE,仅 3B 激活参数)。需 SMVLLMENFORCEEAGER=true(Mamba-Transformer 混合架构要求)、GPU 显存占用 0.85 留 KV cache 余量、开启 prefix caching。
- 压测:CreateAIBenchmarkJob API,负载设定 1024 输入/256 输出 token(典型 RAG 场景),开启流式以测 TTFT,每级 1024 请求串行执行保证测量干净。
- 读数:关注吞吐平台期、p99 延迟穿越 SLA 点、p50-p99 差距(扩大即排队)、TTFT;吞吐曲线拐点即安全并发上限(示例场景为 256)。
「Infra」频道最新
- Reka EdgeQ 端侧 VLM 登陆骁龙 8 Elite,首 token 仅 0.73 秒 — RekaAILabs · 2026-09-23
- Ben Bajarin:FMS 大会释放信号,CXL 解体式内存明年起规模部署 — BenBajarin · 2026-09-23
- 想让 AI Agent 安全跑 ComfyUI?单卡 GPU 半虚拟化是个坑 — johnshedletsky · 2026-09-23
- Unsloth 量化让 Qwen-Image-2.1 仅需 6GB 显存本地运行 — danielhanchen · 2026-09-23
- H Company 用 SkyPilot 训练 computer-use 模型,沙盒秒级冷启动 — skypilot_org · 2026-09-23
- MiniMax H3 上跑 M5 Ultra 实测:768p 视频约 2 分 22 秒生成 — bakawolf123 · 2026-09-22