PyTorch 2.13 发布:FlexAttention 登陆苹果芯片,大词表模型显存暴降 4 倍
PyTorch · x · 2026-08-01
PyTorch 2.13 正式发布,主要亮点包括:
- FlexAttention 支持 Apple Silicon:此前该特性主要面向 CUDA,现在苹果芯片也能用。
- 大词表模型显存优化:新增 nn.LinearCrossEntropyLoss,可将大词表模型的峰值显存降低至多 4 倍。
- 稀疏场景显著提速:FlexAttention 会根据请求的 masking 模式编译专用内核以跳过不必要的计算,在测试的稀疏配置下比 SDPA 快约 12 倍,并在 CUDA 上提供确定性的反向传播路径。
- 其他更新:改进了分布式训练、编译、性能分析和端侧推理。
官方 Q&A 还探讨了 CUDA 版本支持、CuTeDSL、Python 3.15 以及 PyTorch 2.14 的规划。
所属事件:PyTorch 2.13 发布:支持苹果芯片并大幅优化显存(2 条相关)→
「Infra」频道最新
- 探讨 4x 5060Ti 本地部署 DeepSeek V4 Flash 优化 — Ambitious_Fold_2874 · 2026-08-01
- 达索联手 NVIDIA:用 AI 与 GPU 大幅缩短工程仿真时间 — NVIDIA Developer · 2026-08-01
- Cerebras 极速推理体验获赞:用过就回不去了 — soumitrashukla9 · 2026-08-01
- 本地开源大模型性能已达两月前前沿水平 — ccerrato147 · 2026-08-01
- 端侧与云端大模型的「扩散滞后」:2028 年端侧 4B 模型将追平 2026 前沿大模型 — almostsweet · 2026-08-01
- Meta工程师分享 MLSys 演讲:用 AI 解放系统研究员 — salykova_ · 2026-08-01