512 块 AMD MI355X 跑出 575 万 tok/s,创 MLPerf 最大规模推理纪录
wkmyrhang · x · 2026-09-17
Crusoe 在 MLPerf Inference v6.1 提交中用 512 块 AMD Instinct MI355X GPU 运行 gpt-oss-120b 和 DeepSeek-R1,吞吐量达 575 万 tokens/s,是 MLPerf 历史上最大规模的 MI355X 推理提交。
三个关键发现:
- 吞吐量从 8 卡到 512 卡保持超过 90% 理想值的近线性扩展,意味着可按预期负载确定性自动扩缩容
- 不需要跨节点 RDMA 互连:整个 512 卡集群通过标准 400Gb 以太网协调,无 InfiniBand/RoCE、无跨节点 all-reduce
- 全程以普通 Kubernetes 工作负载跑在生产级托管平台上,manifests 已开源可复现
「Infra」频道最新
- 黄仁勋:安全测试前沿模型将成训练推理之外第三大算力需求 — rohanpaul_ai · 2026-09-17
- 黄仁勋:1GW AI 工厂砸 500-600 亿美元,一年租金即可回本 — rohanpaul_ai · 2026-09-17
- Ilya 警告:Neocloud 网络安全薄弱,失控 Agent 可能劫持其算力自我复制 — Miles_Brundage · 2026-09-17
- AMD AI 开发者计划免费开放:入会即送 100 美元云额度 — wkmyrhang · 2026-09-17
- AWS me-central-1 数据中心损毁,用户每周向 Codex 解释故障缘由 — andersonbcdefg · 2026-09-17
- 内存危机才刚开始:AI 需求挤压 DRAM 供应链预警 — perelin · 2026-09-17