H3音频生成工作流:通过AudioSR实现48kHz高保真上采样

AppointmentOk972 · reddit · 2026-08-11

作者分享了一种基于 H3 模型的音频生成与优化工作流。通过修改官方 T2VA 工作流,将 32x32 的图像维度作为输入以最小化视频生成时间,并绕过视频 VAE。

核心技巧在于将 Audio VAE 的输出接入 AudioSR 自定义节点,从而实现 48kHz 的高质量上采样,并最终保存为 FLAC 格式。作者表示,这种动态和声场效果令人印象深刻,并建议将 AudioSR 上采样技巧整合到常规视频工作流中。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →