fal 把开源视频模型提速 35 倍,GPU 利用率拉到 70-80% 实现实时流式生成
isidentical · x · 2026-09-18
a16z 访谈 fal 的 Gorkem Yurtseven 与 Batuhan Taskaya,讲述如何把 MiniMax 开源的 H3 视频模型做成超实时生成:
- fal 的做法是砍掉模型生成视频的步数、重写各阶段底层代码,把 GPU 利用率从通常的 30-40% 提到 70-80%,且不损失质量,整体提速 35 倍
- 一位工程师 Rehan 用笔记本对 H3 Max 做连续生成的直播,通过 prompt 技巧维持故事连贯性,并在 Twitch 上开播
- 团队称这是唯一能生成最长 60 分钟连续、可动作控制视频的模型,理论上可以无限流式生成(他们限制在 1 小时)
- 工程师感叹过去从未有一个视频模型能 5 秒内生成 5 秒视频,H3 Max 打破了这个限制
- 视频生成已经便宜和快到终端用户不再关心速度和价格,竞争焦点转向质量与 prompt 遵循度;好莱坞一年前还不是客户,现在已经主动找上门
所属事件:fal 将 MiniMax 开源视频模型提速 35 倍,好莱坞成最快增长客户(4 条相关)→
「Infra」频道最新
- 开源模型落地下一个瓶颈是存储:2027 年或成 HDD 大爆发之年 — cocktailpeanut · 2026-09-18
- p0 Parallel Search 上线 Baseten,为开源模型提供低价联网搜索 — baseten · 2026-09-18
- Neon 后端正式 GA:面向应用与 Agent 的数据库原语全家桶 — matei_zaharia · 2026-09-18
- 三元权重 27B 模型 Bonsai 2 不足 6GB,WebGPU 浏览器内可跑 — xenovatech · 2026-09-18
- HyperQwen 项目招募 4090/5090 用户优化 Qwen 本地推理速度 — iamMess · 2026-09-18
- REBCO 高温超导带材:50 特斯拉磁场背后的稀土供应链 — Anen-o-me · 2026-09-18