豆包与 Qwen 语音模型:10 秒语音即可低成本复刻音色

AlchainHust · x · 2026-10-06

AI 圈博主 Alchain 分享:豆包和 Qwen 的语音模型只需投喂约 10 多秒的语音样本,就能把音色复刻得相当好,而且价格便宜。他建议可以让自己的 agent 去调用这类语音克隆能力,比如在回复 @good70615133 时提到,用 VoxCPM 效果不理想的话可以换这些方案试。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →