谷歌等推出 SepGen:一个模型同时生成视频与分轨音源
YonatanBitton · x · 2026-10-11
特拉维夫大学与 Google 研究者发布 SepGen,把预训练音视频生成模型扩展为单次前向即输出每条声源的独立波形(连同视频与混音),支持生成与分离双模式:既可按文本描述为每个声源生成独立音轨,也可把现有视频的混音拆成多轨。
由于各声源可单独寻址,研究者将它们放入升维后的 4D 场景,从新视角渲染出空间音频;论文还提供了可交互 demo,可在场景中走动、转动视角并听到声音随方位变化。附加训练在不改变原混音的前提下提升生成质量,语音任务上表现最强。
「多模态」频道最新
- 用 Kling 4.0 Flash 测试:AI 能否从双视角复现同一瞬间 — umesh_ai · 2026-10-11
- 花叔开源艺术动画 Skill:35 种艺术风格加 9 种解说语法 — AlchainHust · 2026-10-11
- Qwen-Image Edit 获 ComfyUI 原生支持 — saroxel · 2026-10-11
- Seedance 2.5 生成 AI 视频被赞「杰作」,效果惊艳 — SimplyAnnisa · 2026-10-11
- Anthropic 推出 Claude Motion:一句话生成可下载 MP4 动画解说 — PrajwalTomar_ · 2026-10-11
- 第 85 期周日视频挑战:以「蜕变」为主题的 AI 视频创作赛 — LudovicCreator · 2026-10-11