Minimax H3 给了参考音频仍输出机械味,Reddit 求解
nettek · reddit · 2026-09-26
一位用户反映 Minimax H3 即便提供了多条清晰的参考音频,生成的声音仍然机械、不像真人。他给出了完整运行配置:RTX 5060 Ti 16GB、48GB 内存,模型用 Q8 GGUF 或 ref2vaprunedint8convrot,VAE 用 Kijai 的 video VAE 加官方 audio VAE,文本编码器为 Qwen 32b,并启用 MiniMaxChunkFeedForward、Low VRAM Attention、Comfy-Kitchen、块/稀疏注意力加速等省显存节点,未用 turbo LoRA。
他搜到少数人有同样问题,建议换 euler 或 heun 采样器,但对他只是略有改善。帖中征集更多解决思路。
「多模态」频道最新
- Cartesia 语音克隆支持 25 种语言,换语言保留原声一键实现 — anthara_ai · 2026-09-26
- 非程序员用 AI 造出 Qwen 图像提示词离线管理工具 — SuperCasualGamerDad · 2026-09-26
- 用 Opus 5.5 从仓库代码生成 RSS 插件宣传视频 — vista8 · 2026-09-26
- 实测 MiniMax H3 长视频编辑器:拼接 Latents 轻松做出 45 秒连续长镜 — InariKirin · 2026-09-26
- 用 Opus 5.5 复刻合成器 OP-1 并做宣传片:附完整 AI 建模工作流 — YaBoiSunblock · 2026-09-26
- 实测 Qwen 2.1 扩图又快又好:黑边填充加一句提示词即可 — -Silhouette- · 2026-09-26