12GB 显卡跑 MiniMax H3:量化格式、加速 LoRA 与注意力方案怎么选

Possible_Mood676 · reddit · 2026-09-11

一位 Reddit 用户在 ComfyUI 中部署 MiniMax H3 视频模型,面向 RTX 4070(12GB 显存/32GB 内存)寻求速度与质量的最佳平衡,目标是 768p、5 秒的 I2V/First-to-Last 生成。作者指出加载未剪枝的 FP8 模型会大量换页到内存导致卡顿,并就三个问题征求社区共识:

帖子本身是求助提问,尚无答案,但对低显存部署该视频模型的实践选型有参考线索。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →