在核显上跑 22B 视频模型 LTX-2.5:权重留 NVMe 逐层流式加载
Business_Swordfish_5 · reddit · 2026-10-09
一位想转推理工程的学习者挑战了看似不可能的组合:在只有 15.6 GB 共享内存的 Intel Core Ultra 5 核显上,以 bf16 无量化跑 22B 的 LTX-2.5 视频模型(含音频)。
核心做法:
- 模型约 66 GB,从不整体载入;权重留在 NVMe 上按层流式读取
- 对齐读入小型 pinned buffer,预取线程在计算第 n 层时加载第 n+1 层,用 hooks 换入换出权重
- 使用蒸馏模型,支持文生视频、图生视频和原生音频生成
实测速度(这台机器):
- 动漫片段 5.4s / 1536x896 含声音:约 14 分钟
- 最佳质量真 24fps:约 47 分钟
- 写实片段 4s / 1280x704:约 20 分钟
已知问题:快速运动模糊、动漫 12fps 每帧重复两次、CUDA 路径未测试。作者还记录了完整踩坑日志(内存对齐、bf16 下 vocoder 输出静音等),repo 开源:github.com/DARK-Shadw/ltx25-igpu-streaming。
「Infra」频道最新
- TRL v1.15 融合 LM head,峰值显存省 82%、序列长 7 倍 — QGallouedec · 2026-10-09
- 亚太数据中心缺口 2800 亿美元,柔佛成最大新建市场 — shashib · 2026-10-09
- Stepped MoE 论文:单个模型可缩放为 1-4B,端侧精度反超同级稠密模型 — pmttyji · 2026-10-09
- DLoop 循环式投机解码:目标模型前向减少,实测加速提升 5-41% — pmttyji · 2026-10-09
- OpenTelemetry 提出原生可观测设计:产品天然可对接任意观测栈 — dhruv_ahuja · 2026-10-09
- 单张 RTX 5090 跑 MiniMax H3:15 秒视频实测 0.8MP 是极限 — Realistic-Fennel-190 · 2026-10-09