B200 实测:NVFP4 解码比 MXFP4 快至多 8%,小批量推理应优先选用
StasBekman · x · 2026-10-11
Cezar Cocu 发布了一份针对真实推理工作负载的 NVFP4 vs MXFP4 基准测试(此前多为格式层面的纸上对比)。
- 实验设置:在 B200 上用 vLLM 服务 Qwen3-32B 稠密模型,两种格式均从同一份 BF16 权重从头量化,尽量排除混杂变量。
- 核心结论:B200 上应基本总是选 NVFP4——小批量下解码快至多约 8%,GEMM-bound 训练场景 NVFP4 也占优(大 GEMM 快约 9%,但具体取决于 kernel)。
- 反直觉发现:性能差距在更大 batch 下消失,作者起初以为是 HBM 带宽瓶颈所致,实际分析发现原因并非如此(文中给出展开)。
- 基准代码主要由 Claude 搭建、作者运行,方法可复现。
「Infra」频道最新
- 算力都砸在能力上没人做「常驻」?创业者提出 Agent 杠杆三因子 — nbaschez · 2026-10-12
- 分析师:自建开源模型是英伟达的博弈论最优解,封闭模型反成生存威胁 — Rewkang · 2026-10-12
- 双卡昇腾 310P 跑通 GLM-5.3-Flash:8 tok/s、31 万上下文实录 — matteiuspi · 2026-10-12
- SemiAnalysis 估算 Anthropic 订阅用户每美元算力约为 API 用户的 4 倍以上 — rohanpaul_ai · 2026-10-12
- 数据中心停产禁令蔓延,AI 业界靠废除 NDA 能否扭转口碑 — TechCrunch AI · 2026-10-12
- GPU 实测吞吐表新增 B300/MI355X 等,B200 实际仅达理论值 77% — StasBekman · 2026-10-12