从零推导构建 PyTorch 分布式训练框架
hkproj · x · 2026-08-18
这是一部极长视频教程,从第一性原理出发使用 PyTorch 构建分布式训练框架。内容包括推导数学原理、Multi-head Latent Attention (MLA)、RoPE、YaRN 等组件。详细讲解进程组、Rank、集合通信、分布式 Autograd、设备网格与张量,并实现流水线并行、数据并行、FSDP、HSDP、张量并行和上下文并行等现代 LLM 训练的核心并行技术。
「Infra」频道最新
- 五台 DGX Spark 全天跑 vLLM 发热,元凶不是 GPU — EAccelerate_42 · 2026-08-18
- 单透镜实现超快傅里叶变换与光学 AI — MeasurementDull7350 · 2026-08-18
- 开发者构建OpenRouter推理提供商市场份额仪表盘 — Ronangmi · 2026-08-18
- Rebellions高管解析主权AI三大支柱:基建、数据与专业知识 — DavidBennett__ · 2026-08-18
- 哈佛研究:LLM 服务缓存效率受流量模式影响 — rohanpaul_ai · 2026-08-18
- Qwen 本地推理配置指南:控制思考开销 — Altruistic_Heat_9531 · 2026-08-18