豆包与 Qwen 语音模型:10 秒语音即可低成本复刻音色
AlchainHust · x · 2026-10-06
AI 圈博主 Alchain 分享:豆包和 Qwen 的语音模型只需投喂约 10 多秒的语音样本,就能把音色复刻得相当好,而且价格便宜。他建议可以让自己的 agent 去调用这类语音克隆能力,比如在回复 @good70615133 时提到,用 VoxCPM 效果不理想的话可以换这些方案试。
「多模态」频道最新
- Veda 稀疏注意力 ComfyUI 节点:12GB 显存渲染 5 秒视频快 2.9 倍 — lmoroney · 2026-10-06
- invideo 推出 MCP:接 250+ 模型搞定文生视频全流程 — aziz4ai · 2026-10-06
- Higgsfield 宣称所有爆款 AI 网红皆出自其平台,遭讽从好莱坞转向造假网红 — kyliebytes · 2026-10-06
- GPT-6 ASTRA 生成雨夜便利店街景视频,网友晒 prompt 实测效果 — iamfakhrealam · 2026-10-06
- OmniChar 发布声音克隆版:10 秒语音样音即可锁定角色声线与口型 — ashishsanu · 2026-10-06
- MiniMax H3 无缝长视频工作流升级:双采样+色彩迁移,接缝几乎不可见 — wjc_5 · 2026-10-06