H3 文生视频显存困境:开发者提议把 32B 文本编码器搬上云端 API
frankmanbb · reddit · 2026-09-29
H3 本地用户面临显存两难:DiT 约需 20–25GB,而文本编码器是截断的 Qwen3-VL-32B,两者无法同时塞进 24–32GB 显卡——留着编码器则采样时爆显存,卸载则每次出提示词都要等。作者因此考虑做一个「纯文本编码 API」用于 T2VA:
- 用户发送 prompt,API 返回 H3 兼容的文本条件张量
- DiT 和 VAE 保留在本地 GPU 采样,仅替换 Comfy 的文本编码节点
- 不做托管视频生成,首末帧与参考图仍走本地视频 VAE
- 核心诉求:不必为了读一条 prompt 就加载 32B 模型
作者在征集需求信号:是否会用这类服务、用什么显卡、是编码器驻留还是 DiT 驻留更痛、张量需否与官方 H3 TE 包完全一致等。
「Infra」频道最新
- LayerSkip:单模型自推测解码,免掉独立草稿模型的推理加速框架 — burkov · 2026-09-29
- SpaceX 官宣超级计算机、Terafab、Gigasat 等多项基建布局 — elonmusk · 2026-09-29
- 马斯克称算力将迁往太空,Google 先验证 TPU 能否在太空工作 — CackleRooster · 2026-09-29
- Gimlet 与 Cerebras 规划 100 MW 算力,推理速度可达 3000 tokens/秒 — Sethwinterroth · 2026-09-29
- 单卡 3090 跑 Qwen 27B 达 95+ TPS、262K 上下文,LlamAmpere v0.4 发布 — Brief-Tap-6616 · 2026-09-29
- 美国人更反对在家门口建数据中心,而非核反应堆 — PeterDiamandis · 2026-09-29