Ref2VA 模型实测:3 张参考图精准复刻人物音视频

rjay7979 · reddit · 2026-08-05

一位开发者展示了使用 Ref2VA 模型进行音频驱动视频生成的实测效果。在该演示中,用户仅需提供 3 张不同对象的参考图片,外加一段 Gilbert Gottfried 的音频片段作为参考,模型即可生成对应的视频。作者还特别测试了模型是否原生“认识”该名人的声音。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →