fal 推出 H3 Max 唇形同步模型:中位生成仅 11 秒,质量速度双第一

jfischoff · x · 2026-09-19

fal 正式上线 H3 Max Lip Sync:用户上传一张照片和一段音频,几秒内即可生成唇形同步视频,表情与动作自然,支持任意语言。

据 fal 自家评测,该模型在质量与速度两项均排名第一,中位生成时间仅 11 秒。开发团队 isidentical 介绍,他们用扩散强化学习(diffusion RL)拓展到新的可验证任务上,唇形同步正是其中之一——这个方向的惊喜在于它可以通过 RL 持续优化,最终做出据称全球质量最高、最快也最便宜的 lip-sync 模型,底层构建在 fal 的 H3 Max 架构之上。

所属事件:fal 推出 H3 Max 唇形同步模型,秒级生成说话视频(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →