NVAlign:梯度直传让流匹配 TTS 精准控制非语言发声标签
BlandAIOrg · hf · 2026-09-30
- 问题:现代 TTS 能生成自然语音并支持内联非语言发声(NVV,如笑声)标签,但在这类连续自回归流匹配架构上,缺乏对标签精准控制的后训练方法。
- 方法:提出 NVAlign 后训练框架——先对 TTS 模型和 NVV 感知 ASR 模型做标注数据的监督微调,再冻结 ASR 作为奖励模型;通过两步梯度替代(surrogate)把奖励反传穿过流匹配采样器,联合更新自回归主干与声学流头;并加入保真惩罚与参考速度正则以保持说话人相似度和音质。
- 结果:在 NVV-SuperBench 与人耳听测上,标签遵循准确率均优于 SFT 与 Flow-GRPO 基线。
- 音频示例见 nvalign.github.io。
「研究」频道最新
- Gary Marcus 重提 2020 旧文:LLM 不够,下一代 AI 需更深理解 — GaryMarcus · 2026-09-30
- 新论文提出 DepthBench:残差连接设计决定模型有效计算深度上限 — teortaxesTex · 2026-09-30
- Xcelsa AI 修芯片时序违例:3 小时搞定通常需一个月的活 — IanAndrewsDC · 2026-09-30
- Fatima Fellowship 春季超700人申请,秋季批次开放报名 — deliprao · 2026-09-30
- flyverse 开源框架:把完整果蝇连接组放进可扩展模拟环境 — repligate · 2026-09-30
- littmath:模型写得好之后,人类写作将只为帮自己想清楚问题 — littmath · 2026-09-30