MLX gated-delta 训练提速:PR #1217 VJP 内核实测

Nihongi-studier12387 · reddit · 2026-08-14

开发者发现在 MLX 框架中训练 Qwen 3.5 的 gated-delta 层时,线性注意力机制会关闭融合内核(fused kernel),导致训练时退化为 Python 循环,严重拖慢速度并占用大量内存。

通过切换至 PR #1217 引入的 gated-delta VJP(向量-雅可比积)内核,性能获得显著提升:

作者呼吁社区测试该 VJP 路径在不同形状或上下文长度下是否存在漂移问题,并探讨其合并入主分支的可能性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →