40G 显存训练 Qwen3.8-Flash-Next:LoRA over GGUF 无需 CPU offload

woct0rdho · reddit · 2026-10-09

作者更新其 LoRA over GGUF 系列:现在可在 40 GiB 显存内训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram),无需 CPU offloading,engram 放在磁盘上也不拖慢训练速度。

在 Strix Halo 上,上下文 chunk 2048 时为 9.5 s/it,约 200 token/s;相比已实现的 >1600 token/s 推理(prefill/PP),仍有优化空间,且通常 LoRA 训练开销约为 PP 的 2-3 倍。自 transformers 5.18 起,现代 GGUF 的初始支持已合并,后续会有更多工作。

预告:torch-ggml-ops 中有个 GGTensile,类似 Tensile 的 MMQ 内核汇编级优化,部分场景已快过 HIP。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →