MiniMax H3 生成语音「贴太近」太响亮,作者求教音频 LoRA 解法

Dogluvr2905 · reddit · 2026-09-13

楼主称赞 MiniMax H3 的能力,但指出其生成的语音(无论来自参考音频还是模型自行生成)总是过于响亮、听起来像「贴在」场景里, acoustic 上与环境不融合——像是角色对着几厘米外的麦克风说话。他已尝试大量 prompt 组合和传入低音量的参考音频,均无效。核心问题:能否训练一个 LoRA 让 H3 的生成语音更轻、更「远」,从而在混音中更好地融入环境?向社区求思路。这条帖子的价值在于揭示了 H3 语音输出的一个共性缺陷(近讲、缺乏距离感/环境混响)。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →