实测:CUDA版本导致量化视频模型推理速度相差3.3倍,B200不敌正确配置的4090

Odd_Lavishness2236 · reddit · 2026-08-14

Reddit用户分享迁移LTX-2.5视频模型时的性能对比。同一4090显卡,仅将PyTorch从2.8.0+cu129升级到2.13.0+cu130,推理速度提升3.3倍(89.4s/clip vs 27.1s/clip)。原因是低于cu130时ConvRot权重被上转为bf16,导致量化失效。另外,ComfyUI的--fast fp8matrixmult标志对B200等数据中心卡也有显著影响(58.0s→28.1s)。作者强调,在比较GPU性能前务必检查torch版本,否则结论可能完全错误。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →