微调 Qwen3-TTS 加入情绪控制标签,还发现情绪向量可跨说话人迁移
ProfessionalHorse707 · reddit · 2026-09-10
开发者用「内联转写控制标签」微调 Qwen3-TTS,替代单独的指令参数,开源了 qwen3-tts-emotion-tags。
做法:以 Qwen CustomVoice 模型为教师,用自然语言指令(如「用强烈愤怒的语气说」)生成音频,配离散控制 token(如「Anger」)让学生模型学习。语料约 9 个预置音色 × 每音色 8200 条,共 7.4 万条,最后加 LoRA。
踩坑:
- codec 前缀问题:language="Auto" 与显式指定语言会生成不同 codec 前缀,只用一种训练会在另一种推理时产生短语边界的蜂鸣声;解决是语料按约 80/20 同时覆盖两种前缀。
- 并发生成影响韵律:用 vLLM 以 10 并发生成语料会引入撕裂感,被迫降到 c1/c2。
意外发现:情绪在说话人 embedding 空间中近似「仿射」——对各说话人计算每情绪质心、减去中性质心得到任务向量,加到另一说话人的 xvec 上即可让克隆音色带上该情绪(主要沿 arousal 轴),无需为该说话人单独训练。
「多模态」频道最新
- fal 改进媒体生成模型服务,用户称计费方式不再"扣得可疑" — nijfranck · 2026-09-10
- 7500 万播放神视频的复刻 prompt 首次流出,网友直呼要试 — techhalla · 2026-09-10
- 斯坦福发布 RenderFormer-V2:Transformer 神经渲染支持异构场景 — Stanford · 2026-09-10
- Nitx Studio 接入「GPT Image 2.5」,称无需会画画也能出图 — aziz4ai · 2026-09-10
- SOL Attention + SageAttention:Apple Silicon 上视频生成提速 2.5 倍 — TgoAI · 2026-09-10
- Runway 推出 MCP,让 Claude、ChatGPT、Cursor 直接生成视频 — tlakomy · 2026-09-10