提案:把图像 RefMod 机制移植到音频,为 MiniMax-H3 打造声音风格适配器

ledadu · reddit · 2026-09-17

作者提出为 MiniMax-H3 构建「Audio RefMod」,把视觉领域 Latent Adapter/IP-Adapter 的机制移植到音频条件化,并招募社区合作做 POC。

问题:当前音频喂给视频/音频 DiT 时按时间轴逐帧处理,适合唇形同步等任务,但若只想注入整体风格(音色、房间混响、音乐流派),处理完整时间序列既耗显存又容易 OOM。

方案机制:

预期收益:可像图像 RefMod 一样堆叠多个音频参考(音色 A + 声学 B)而不增加推理负担;压缩后 safetensors 仅约 1-5 MB,ComfyUI 秒加载;风格与同步解耦(唇形同步用标准音频输入,声音身份用 RefMod)。

可行性:冻结大模型只训练 adapter,租 1-2 张 A100 80GB 跑 48-72 小时,成本约 $100-250 即可出 POC。作者在征求架构、数据集与 ComfyUI 节点三方面的合作者。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →