腾讯开源语音基础模型 AuK:自然语言指令统一生成与编辑
realmrfakename · x · 2026-09-10
腾讯发布并开源语音基础模型 AuK(1.5B 参数),用自然语言指令统一语音生成与编辑,权重完全开源。
- 能力覆盖五大任务族:语音生成、内容编辑、增强与分离、副语言编辑(如换口音、注入愤怒情绪)、声学编辑(修背景噪音、替换单个词)
- 零样本声音克隆:无需参考转录文本,另有完整 TTS、人声分离与录音棚级降噪
- 规模惊人:构建约 30.3 亿条指令-音频样本、约 195 万小时有效监督数据,官方错误率仅 2.65%
- 架构:多模态 LLM 做语义条件 + 覆盖语音/通用音频/音乐的音频 VAE + 混合整流流 Transformer(dual-stream MMDiT)
- AuK-Flash:两阶段蒸馏(轨迹级一致性初始化 + 解耦 DMD),4 步推理即可接近教师模型质量,无需 CFG
适用于配音、播客、游戏音频等场景,依赖 Qwen3-Omni/ASR/ForcedAligner。
「多模态」频道最新
- 不发一张生成帧,用剪辑拼出 12 秒 AI 广告 — Careful_Dependent_78 · 2026-09-10
- Suno v6-wild 新模型上线,网友试听 20 年后风格歌曲 — almostsweet · 2026-09-10
- GMI Cloud×MiniMax 联办 H3 视频模型实战直播:从提示词到出片并开放 Build Challenge — MiniMax_AI · 2026-09-10
- 开发者用 GPT-6 与自研工具一条 prompt 生成巴赫风格赋格 — HankYeomans · 2026-09-10
- 假想苹果出雨伞:一条推演示 AI 广告全流程制作 — Aiden_Tech_Ai · 2026-09-10
- 实测 H3 Director:文字指令自动配乐生成视频,上手极简 — jfischoff · 2026-09-10