PyTorch 携手 AMD 优化 FP8 训练:吞吐量提升超 13%
PyTorch · x · 2026-08-14
PyTorch 官方博客发文,详细介绍了 AMD 如何在 PyTorch/TorchTitan 和 PyTorch/TorchAO 中上游化优化 FP8 训练支持,使 AMD Instinct GPU 能够开箱即用地运行 FP8 训练。
主要优化成果包括:
- 密集模型:Llama3-8B 相比 BF16 实现了 13.4% 的吞吐量提升。
- MoE 架构:针对 DeepSeek-V3 671B 等模型,通过融合 Triton 量化内核,恢复了 89% 的 FP8 量化开销,部分内核优化带来了最高 6.2 倍的加速。
这些改进通过系统性地融合 Triton 量化内核、为 ROCm 启用分组 GEMM 以及构建 Triton 融合流水线实现。
「Infra」频道最新
- 计算机系统新前沿:多机共享内存的无限可能与挑战 — lauriewired · 2026-08-14
- 折腾矿卡:CMP 170HX 运行 llama.cpp 提速 50% 实测 — fragment_me · 2026-08-14
- OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 推理速度飙升 14 倍 — OpenAI · 2026-08-14
- 如何用机器学习与硬件计数器检测性能回归? — ZeroDark_Hereford · 2026-08-14
- Polymarket押注英伟达年底市值登顶,概率高达73% — Polymarket · 2026-08-14
- 驳斥AI数据中心七大流言:耗水、推高电价纯属无稽之谈 — Dan_Jeffries1 · 2026-08-14