VUILabs Luna-TTS 登顶全球语音榜,采用扩散模型破局

新智元 · wechat · 2026-08-14

中国 AI 初创公司 VUILabs 推出的 Luna-TTS 模型在 HuggingFace TTS Arena 等权威榜单上击败 ElevenLabs 等大厂登顶。该模型颠覆了传统自回归(AR)架构,采用基于扩散模型的语音生成系统,解决了长句延迟和累积误差问题。

技术上,Luna-TTS 从 Qwen3-0.6B 初始化,结合 Luna-Codec 的语义锚定与声学解耦,并成功将 GRPO 强化学习迁移到离散掩码扩散模型上。其流式分支在 2 张 H20 GPU 上首包延迟仅 41.6 毫秒,实时倍率低至 0.024。此外,团队构建了百万小时语料库与精细情绪标签,使其能自然呈现呼吸、叹息等真实交流质感。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →