VUILabs Luna-TTS 登顶全球语音榜,采用扩散模型破局
新智元 · wechat · 2026-08-14
中国 AI 初创公司 VUILabs 推出的 Luna-TTS 模型在 HuggingFace TTS Arena 等权威榜单上击败 ElevenLabs 等大厂登顶。该模型颠覆了传统自回归(AR)架构,采用基于扩散模型的语音生成系统,解决了长句延迟和累积误差问题。
技术上,Luna-TTS 从 Qwen3-0.6B 初始化,结合 Luna-Codec 的语义锚定与声学解耦,并成功将 GRPO 强化学习迁移到离散掩码扩散模型上。其流式分支在 2 张 H20 GPU 上首包延迟仅 41.6 毫秒,实时倍率低至 0.024。此外,团队构建了百万小时语料库与精细情绪标签,使其能自然呈现呼吸、叹息等真实交流质感。
「多模态」频道最新
- 18秒一镜到底!Seedance 2.5 马尔代夫度假视频提示词 — techhalla · 2026-08-14
- DotSight发布280B开源多模态模型,Apache 2.0许可 — Xianbao_QIAN · 2026-08-14
- Wan 3.0 官方 64 个提示词曝光:每个都是 30 秒分镜脚本 — Tricky_Algae2625 · 2026-08-14
- AI 恐怖说唱《Syko Sam》发布,AI 音乐创作再添新作 — JonMillaTheKilla · 2026-08-14
- Seedance2.5生成一句话摇滚MV,现实与AI界限模糊 — Eric520CC · 2026-08-14
- MiniMax 图生视频新玩法:结合 fl2va 与 ref2va 实现声音克隆 — spiderofmars · 2026-08-14