EmoRES:免训练向量转向让 TTS 情感可控性最高提升 118.8%
meta · hf · 2026-09-30
情感可控 TTS 常不可靠,而加训练成本高。EmoRES 采用免训练的向量转向方法,发现情感向量可分解为“远离中性”的共享分量与“指向目标情感”的残差分量,并提出分别控制两者的 EmoRES 方法。
在 IEMOCAP、基于 IndexTTS-2 与 CosyVoice2 两个骨干上的结果:
- 情感 rank correlation 分别提升 26.13 与 12.97 个百分点(相对提升 118.8% 与 33.1%)
- 情感命中率提升 12.95 与 6.92 分(相对 20.1% 与 9.8%)
- 人类评测中,听者对主导情感的识别相对提升最高 35.0%,保真度提升 17.3%,自然度偏好最高 63.8%
「多模态」频道最新
- Midjourney v8.2 新玩法:4 个虚构 token 玩出记忆残影与骨骼回声 — LudovicCreator · 2026-09-30
- 开发者直言超个性化音乐是伪命题:音乐本质是社交文化 — jordiponsdotme · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- 本地生图一年:从 Civitai 到 ComfyUI,体验为何都烂 — BenDLH · 2026-09-30
- 用 Opus 50 分钟做出 Violetto 1B 宣传片,几乎零媒体关注 — tensorqt · 2026-09-30
- 蒸馏视频模型频现伪影,作者长文剖析 LoRA 失配根源 — burkov · 2026-09-30