腾讯开源语音基础模型 AuK:克隆、合成、编辑、增强、分离五合一
aigclink · x · 2026-09-11
腾讯新开源语音基础模型 AuK,把克隆、指令合成、编辑、增强、分离五类任务统一到一个模型里。核心思路是把数据格式统一为「一句话指令+一段输入音频+目标声音」,让同一套模型逻辑处理所有语音生成与编辑任务。能力上可将正常说话改为悄悄话、去除方言口音、加入笑声/叹气等情绪音,也能从零生成新音色。另提供 4.5 倍加速的轻量版,适合 AI 语音助手、客服、批量配音等速度敏感场景。典型应用如一人多角的 AI 广播剧:指令设计音色+多人音轨分离+情绪编辑一条流水线完成。
所属事件:腾讯开源语音基础模型 AuK 登顶 Hugging Face 趋势榜(2 条相关)→
「多模态」频道最新
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11
- 用 Midjourney+Seedance 把龙神宿敌大战拍成 AI 电影短片 — azed_ai · 2026-09-11
- fable 5.1 用 25.6 万条 JS 笔画复刻《星月夜》 — cedric_chee · 2026-09-11
- GPT-6 Astra 接 Hyper3D MCP,一句话生成 3D 资产 — ahuja_priyank · 2026-09-11