MiniMax H3 多主体视频生成翻车:不同角色声音发生串扰

Wide-Researcher583 · reddit · 2026-08-10

用户在使用 MiniMax H3 的 Ref2VA 模型时发现了一个严重的缺陷:在处理包含多个主体的独立参考图像时,不同角色之间的声音会出现「串扰」。

具体表现为:虽然视觉上不同主体的形象得到了完美保留,但在音频分支中,声音特征会发生混淆或一个人的声音特征渗透到另一个人身上。用户尝试了更换随机种子、缩短片段、明确定义主体等多种方法,但目前尚未找到可靠的解决方案。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →