GPU 实测吞吐表新增 B300/MI355X 等,B200 实际仅达理论值 77%
StasBekman · x · 2026-10-12
Stas Bekman 维护的 MAMF/MSMF 大模型训练加速器实测吞吐榜新增多款架构数据,包括 NVIDIA B300/B200/H200 NVL、AMD MI300X/MI325X/MI350X、Intel Gaudi 2/3 等,由 SemiAnalysis、Hugging Face 等贡献实测结果。
BF16 矩阵乘实测亮点:
- B300 SXM:MAMF 1892 TFLOPS,达理论值 84.1%,目前榜首
- B200 SXM:MAMF 1737,但仅达理论 77.2%,MSMF 只剩 64.0%
- H100 SXM:858(86.8%),A100 PCIe 达 91.3%
- AMD MI355X:1565,仅达理论值 62.6%;MI300X 更只有 48.8%
该表以社区实测的最大可达/可持续矩阵乘 FLOPS 衡量各卡,显示 NVIDIA 老卡实际利用率高,而新一代大卡与 AMD 卡「理论-实际」差距明显。
「Infra」频道最新
- Matthew Berman:不报 tokens/s 就说机器能跑哪个模型没有意义 — MatthewBerman · 2026-10-12
- LangChain 创始人:常驻机器是 agent 的弱点,并行跑任务才是正解 — zeeg · 2026-10-12
- 自建 GPU 还是买 token?关键看你能否榨够每卡 token 数 — zainhas · 2026-10-12
- 批量 Agent 任务成新范式:现有 Realtime 与 Batch API 都不合身 — Instance_Not_Found · 2026-10-12
- 算力都砸在能力上没人做「常驻」?创业者提出 Agent 杠杆三因子 — nbaschez · 2026-10-12
- 分析师:自建开源模型是英伟达的博弈论最优解,封闭模型反成生存威胁 — Rewkang · 2026-10-12