40G 显存训练 Qwen3.8-Flash-Next:LoRA over GGUF 无需 CPU offload
woct0rdho · reddit · 2026-10-09
作者更新其 LoRA over GGUF 系列:现在可在 40 GiB 显存内训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram),无需 CPU offloading,engram 放在磁盘上也不拖慢训练速度。
在 Strix Halo 上,上下文 chunk 2048 时为 9.5 s/it,约 200 token/s;相比已实现的 >1600 token/s 推理(prefill/PP),仍有优化空间,且通常 LoRA 训练开销约为 PP 的 2-3 倍。自 transformers 5.18 起,现代 GGUF 的初始支持已合并,后续会有更多工作。
预告:torch-ggml-ops 中有个 GGTensile,类似 Tensile 的 MMQ 内核汇编级优化,部分场景已快过 HIP。
「Infra」频道最新
- Bittensor 上的 GPU 云 Lium 半年回购销毁近 270 万美元 SN51 代币 — markjeffrey · 2026-10-09
- 谷歌开源ML Drift:一套代码搞定四大GPU后端,YouTube Shorts帧延迟降40% — lmoroney · 2026-10-09
- 推理平台上线以来供应商翻倍,竞争已压低模型调用价格 — AccBalanced · 2026-10-09
- Liquid Inference 上线一天供应商翻倍,Kimi K3 等价格低于 OpenRouter — AccBalanced · 2026-10-09
- SparseEngine 稀疏优先推理引擎:KV 驱逐下吞吐超 10 倍,Agent 场景提速 2 倍 — Jitai Hao · 2026-10-09
- 数据中心年耗水仅约1立方公里,冲突在选址而非总量 — AryHHAry · 2026-10-09