视频生成痛点:如何跨越片段边界保持音频连贯性?

wh33t · reddit · 2026-08-05

在探讨 LTX2.3 或 MMH3 等视频生成模型的长链式工作流时,作者提出了一个普遍的技术痛点:如何处理跨越视频片段边界的音频连贯性。

目前的主流做法是提取上一段视频的最后一帧作为下一段的起始帧,配合文本提示词生成新片段再拼接。然而,如果画面中的人物需要跨段连续说话,或者背景有持续的音乐和环境音,现有的生成逻辑很难将当前的音频状态传递给下一次生成。作者呼吁社区探讨是否有现成的技术或工作流能够解决这种片段边界处的音频断裂问题。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →