低显存 LoRA 训练已可把 DeepSeek-V4-Flash 装进 90GiB 显存
woct0rdho · reddit · 2026-07-29
- 作者更新了自己在 GGUF 基座模型上的低显存 LoRA 训练进展,称现在已经能在 90 GiB 显存 下训练 DeepSeek-V4-Flash(284B-A13B),并且 不需要 CPU offloading。
- 在 Strix Halo 上,当前速度约为 19 秒/it。
- 文中提到几个“最棘手”的部分——sliding attention、CSA、HCA——现在都换成了作者自己写的 Triton kernel,并声称比见过的其他实现更快。
- 除了训练本身,作者还希望把 GGUF 更深入地整合进 PyTorch 生态,推动更多非训练式模型 surgery 的研究,例如 Heretic;同时指出 mHC ablation 仍然是未解问题。
「Infra」频道最新
- 播客讨论 AI 时代的向量数据库未来 — CShorten30 · 2026-07-29
- Qdrant 联合 Future AGI 和 AWS 讲自我改进检索循环 — qdrant_engine · 2026-07-29
- Google 推出 Gemini 蒸馏服务,面向更小更便宜模型 — ccerrato147 · 2026-07-29
- 在线 3bit 反量化让 27B 模型在 A6000 跑到 24 TPS — cephaloform · 2026-07-29
- OpenRouter 路由 token 的加权均价今年大幅下滑 — maferase · 2026-07-29
- RTX 4090跨三大洲训练16B大模型,去中心化算力网络跑通 — bittingthembits · 2026-07-29