探讨Ostris AI Toolkit直接加载FP8权重
iz-Moff · reddit · 2026-07-10
开发者在显存有限的情况下使用 Ostris AI Toolkit 训练 LoRA 时,设置了 FP8 量化。但工具每次都会先加载完整大小的 Transformer 权重并进行量化,这不仅浪费时间,还导致加载和量化过程中的显存占用达到峰值,极易引发 OOM(内存溢出)错误。发帖者询问为何每次都需要重复此过程,以及如何让工具直接加载已下载的 FP8 权重。
「Infra」频道最新
- NVIDIA 推出 Cosmos 3 Edge 与 DGX Station 开放 agent 栈 — nvidia · 2026-07-21
- 黄仁勋东京会见日本半导体高层 — nvidia · 2026-07-21
- Infinity 启动并融资 1500 万美元 — mmmbchang · 2026-07-21
- 如何参与Stratum并获取$STRAT — rsalakhu · 2026-07-21
- LLM每token能耗或已低于人脑 — jd_pressman · 2026-07-21
- Couchbase 的多模型 AI 架构实践 — AWS ML Blog · 2026-07-21