Turbo-dLLM 开源:新并行策略让长上下文扩散 LLM 训练提速至 7.59 倍
Azaliamirh · x · 2026-09-19
ScalingIntelligence 团队开源 Turbo-dLLM,一个面向扩散语言模型的高性能分布式训练库,核心是新并行策略 Context-Sharded Block Parallelism(CSBP)。
- 8x H100 上,DFlash2 推测解码 drafter 训练在 512K 上下文提速 2.48 倍、1M 上下文提速 7.59 倍;block diffusion 微调提速 1.61 倍,AR→block diffusion 适配提速 1.33 倍
- 加速比随上下文长度增长而扩大,正对准 agent 场景所需的长上下文训练瓶颈
- 相同 GPU 时数下,CSBP 训练的模型在 SWE-bench Verified 和 Terminal-Bench Lite 上得分更高
- 库内含类型化配置、数据运行时、checkpointing 与优化 CUDA 内核,GitHub 已开放
「Infra」频道最新
- Cloudflare 用数学再省 100TB 内存:哈希环缩容的工程权衡 — DanielLockyer · 2026-09-19
- YC Paper Club 9 月 23 日办「替代算力范式」专场,聊光学与生物 GPU — ycombinator · 2026-09-19
- HEIF Heist:一个 C 图像解析器漏洞撬动 OpenAI、Meta、GitHub 等全线 RCE — ccerrato147 · 2026-09-19
- AI 基建市场自我纠错:假数据中心被过滤,真实算力六因子框架走红 — xtbot · 2026-09-19
- Luminal 用 AMD MI300X 跑 FLUX.2,靠便宜算力压低单图成本 — ycombinator · 2026-09-19
- 弗州州长设 AI 工作组并收紧数据中心审批 — The Verge AI · 2026-09-19