美团 LongCat-Avatar 开源:一张照片加音频生成数分钟对口型视频
anthara_ai · x · 2026-10-08
开发者发现开源项目 LongCat-Avatar,只需上传一张人物照片和一段音频,就能生成数分钟长的口型同步说话视频,而这类能力此前通常需要付费 AI 视频产品才能实现。
作者称该项目完全开源免费,过去需要摄影棚、拍摄和剪辑才能做的数字人口播内容,现在一个 repo 就能完成。项目由美团 LongCat 团队发布(帖中附 repo 链接)。
「多模态」频道最新
- 字节发布 DMAD 蒸馏法:一步生成 FID 1.04,多基准刷新纪录 — ByteDance · 2026-10-08
- 网友用 Vidu Q4 + Suno 制作全女性 Fakemon 宝可梦风格斗动画 — RobotMonsterArtist · 2026-10-08
- Luke Wroblewski 实测谷歌新图像模型:更快、更便宜、效果更好 — LukeW · 2026-10-08
- Envato 推出 Burst 模式:一个点子一次生成 6 个图像方向 — eptwts · 2026-10-08
- Kandinsky 6.0 发布:29B Pro 与 3B Lite 视频模型,已支持 ComfyUI — KokaOP · 2026-10-08
- LoCoSplat 去掉 3D 网络,前馈 3DGS 快 4.2 倍、显存省 6.7 倍 — zhenjun_zhao · 2026-10-08