实测:CUDA版本导致量化视频模型推理速度相差3.3倍,B200不敌正确配置的4090
Odd_Lavishness2236 · reddit · 2026-08-14
Reddit用户分享迁移LTX-2.5视频模型时的性能对比。同一4090显卡,仅将PyTorch从2.8.0+cu129升级到2.13.0+cu130,推理速度提升3.3倍(89.4s/clip vs 27.1s/clip)。原因是低于cu130时ConvRot权重被上转为bf16,导致量化失效。另外,ComfyUI的--fast fp8matrixmult标志对B200等数据中心卡也有显著影响(58.0s→28.1s)。作者强调,在比较GPU性能前务必检查torch版本,否则结论可能完全错误。
「Infra」频道最新
- 斥资万亿美元搞基建,只为解百万奖金数学题? — suchenzang · 2026-08-14
- Intel 联手 MiniMax 发布 MXFP4 量化模型,FP4 基准测试登顶 — HaihaoShen · 2026-08-14
- GPU 价格再次暴涨:RTX 6000 Pro 跳涨至 1.5 万 — HankYeomans · 2026-08-14
- 700 欧元组装多卡工作站,本地跑 122B 大模型可行吗? — whatyathinkk · 2026-08-14
- 算力并未真短缺,但租赁条款极苛刻:需签 3-5 年长约 — AccBalanced · 2026-08-14
- 具身智能研发告别单机,云端工作站解决算力与配置痛点 — 量子位 · 2026-08-14