奇技淫巧:将 Minimax H3 降级为实时音频生成器

comfiestncoziest · reddit · 2026-08-07

Reddit 用户发现了一个反直觉的模型用法:通过将视频模型 Minimax H3 的输出分辨率强制设置为极低的 32x32,可以将其作为一个高效的拟音与音频生成器使用。

在搭配 RTX 5090 显卡时,这种模式甚至能实现接近实时的音频生成速度。实验发现,音频质量与图像质量并无直接关联。该方法的稳定生成截止时间约为 45 秒,超过 60 秒后模型生成的语音对话将失去连贯性并产生乱码。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →