16GB 的 9070XT 实测 Flux 2 各量化:BF16 竟比 FP8 更快更稳
Sofa-Sleuth · reddit · 2026-09-25
一位 ComfyUI 新手在 AMD 9070XT(16GB 显存)上系统实测了 Flux.2 9B 各版本与量化方案,结果非常混乱:
- 量化(Q4/Q6/Q8):Q6K 视觉已可接受、Q8 很好,但作为扩散模型时慢到不可用,只能拿来当文本编码器(UDQ8XL 提升明显)。
- INT8Conv:常规节点下与 Q8 一样慢;用自定义节点虽然比 FP8 快,但画质严重劣化(线条变形),怀疑 ROCm 的自定义节点有问题。
- FP8:首次做到又快又好,但耗时极不稳定——同样是 50 步 Base,有时不到 3 分钟,有时要 20-40 分钟;带 2 张参考图在 8-35 分钟间波动。
- BF16 反而惊喜:17-18GB 的 BF16 模型在 16GB 卡上有时比 9GB 的 FP8 更快,画质也更优(FP8 的比例失调、形状怪异得到改善),但生成几张后就会变慢甚至崩溃,需重启。作者现在用 FP8 试稿、BF16 出最终图。
作者质疑 AMD 平台的兼容性与显存管理:同样的任务耗时差 10 倍以上,换精度、换节点结果全在抽彩票,帖子向社区求解释与加速方案。
「Infra」频道最新
- TileRT×AMD 在 8×MI355X 上跑 GLM-5.3 达 469 tok/s,比 GB300 FP4 快 40% — vllm_project · 2026-09-25
- 转述:AI 在 TPU 设计某些方面已强过任何人,但只被当工具看 — burny_tech · 2026-09-25
- 低成本 4 卡推理再添招:x8 转接卡拆 4 个 x4,m.2 也能转 PCIe — TheZachMueller · 2026-09-25
- 网友用双 RTX 5090 以 vLLM 本地部署 27B 模型 — piddlefaffle12 · 2026-09-25
- CLion 2026.2.3 支持 NVIDIA CUDA Tile C++ 语法 — blelbach · 2026-09-25
- AMD 边缘计算新招:单台工厂盒子工作负载达 Jetson 级 2.3 倍 — shashib · 2026-09-25