小米开源 ControlFoley 模型:视频生成音频

apolinariosteps · x · 2026-08-19

小米在 Hugging Face 发布了 ControlFoley,这是一个视频到音频的生成模型。它可以根据视频画面生成匹配的音效,支持可选提示词(prompt)和音频参考引导。目前已在 Hugging Face Spaces 上线演示。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →