MiniMax H3 多主体视频生成翻车:不同角色声音发生串扰
Wide-Researcher583 · reddit · 2026-08-10
用户在使用 MiniMax H3 的 Ref2VA 模型时发现了一个严重的缺陷:在处理包含多个主体的独立参考图像时,不同角色之间的声音会出现「串扰」。
具体表现为:虽然视觉上不同主体的形象得到了完美保留,但在音频分支中,声音特征会发生混淆或一个人的声音特征渗透到另一个人身上。用户尝试了更换随机种子、缩短片段、明确定义主体等多种方法,但目前尚未找到可靠的解决方案。
「模型」频道最新
- 爆料:下周将迎来 Qwen-3.8 27b 与 Grok 4.6 发布 — kimmonismus · 2026-08-10
- 曝 OpenAI 因网络安全隐患暂停新一代模型开发 — JeffLadish · 2026-08-10
- 实测 MiniMax 视频模型:单次输入 50+ 参考图生成视频 — No_Damage_8420 · 2026-08-10
- 开发者实测:DeepSeek 表现常超 Sol — yacineMTB · 2026-08-10
- 英伟达分享 DGX Spark 本地大模型部署指南 — lifebypixels · 2026-08-10
- 35B模型越级打怪?社区质疑其基准污染 — LegacyRemaster · 2026-08-10