NVLink机架上FFN拆分提速
bookwormengr · x · 2026-07-14
这条帖子讨论了在最新机架级 GPU 系统上,把 Attention 和 FFN/MoE 层拆到不同 GPU 服务器上的思路。
引用中提到一个开源实现 FastAFD:面向 GB200 NVL72(72 张 Blackwell GPU,处于同一个 NVLink 域)的 AFD runtime。作者给出的结果是,它能把每 GPU 解码吞吐提升 1.35–1.45 倍。帖子同时附了代码和博客,强调这是围绕新一代 GPU 机架系统的系统级优化思路。
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11