MiniMax H3 开权重本地跑,L40S 上把 32 分钟压到 7.2 分钟
ashishsanu · reddit · 2026-08-04
一位开发者在 L40S 上本地跑 MiniMax H3 开权重,在没有重打包 checkpoint 的前提下,把一段 10 秒视频的总耗时从 32 分钟压到 7.2 分钟。
他给出的关键优化有三项:
- 压缩 transformer:通过分析巨大的 modulation 投影矩阵,发现实际只需要很少的有效维度,于是把模型体积大幅缩小,约省下 26 GB。
- 拆分编码与去噪阶段:让 32B 文本编码器和去噪器不要同时占 GPU,去噪阶段因此提速约 5.9 倍。
- 让 VAE 尽量常驻显存:原本逐层流式加载的策略在显存充裕时很慢,改成按条件常驻后,一次完整渲染又节省了大约 25 分钟。
作者还给出实测:完整流程峰值大约 38.9 GB VRAM、46.7 GB 系统内存,并判断 64 GB 内存会比较舒服。
「Infra」频道最新
- 多智能体工作流会烧掉海量 token,关键是控制重复成本 — HaktanSuren · 2026-08-04
- Next.js 16.3 内存降 90%,还加入智能体专用文档 — cramforce · 2026-08-04
- TokTier 用有状态分词加速智能体服务并保持精确一致 — omarsar0 · 2026-08-04
- Gemma 4 26B 在单张 RTX 4090 上跑到 24 并发 — DynamicWebPaige · 2026-08-04
- K3 被低估了,作者主张企业自建推理基础设施 — hsu_byron · 2026-08-04
- Photon 2.0 把 Moondream、Qwen 3.5 编译成 megakernel — sloppenheimer · 2026-08-04