腾讯混元开源 AuK 语音模型:1.5B 统一指令完成生成与编辑
pmttyji · reddit · 2026-09-12
腾讯混元团队在 Hugging Face 开源 AuK 系列语音模型及论文(arXiv 2609.08936)。AuK 是 1.5B 语音生成与编辑基础模型,基于数百万小时多样化音频训练,所有任务通过统一自然语言指令接口完成:
- 生成:零样本 TTS(参考音频克隆)、无参考音频的指令式 TTS;
- 内容编辑:改写语音内容、保留旋律改歌词;
- 声学编辑:音调(半音)、语速、音量调整;
- 副语言编辑:情绪、音色、去口音、增删呼吸/笑声/咳嗽等非语言声、耳语转换;
- 增强与分离:降噪、语音增强、声源分离。
两个版本:AuK 基础模型与 AuK-Flash(蒸馏版,4 步快速推理),权重均可在 HF 与 ModelScope 下载,附 Cookbook 提供指令模板与 CLI/Python 示例。
所属事件:腾讯混元开源 AuK 语音基础模型五合一(4 条相关)→
「多模态」频道最新
- ECCV 博士联盟展示生成式重摄影:从运动模糊图重建过去与未来帧 — CSProfKGD · 2026-09-12
- 用 Blender 做运镜参考喂给 Seeddance 2.5,产出强效果广告片 — aziz4ai · 2026-09-12
- 「天神四百年一演」:AI 视频掀起东方神话美学狂潮 — Less-Daikon-250 · 2026-09-12
- 头顶篮筐、挥手的手,这张 AI 生成合影的物理一致性惊艳 — misovalko · 2026-09-12
- 实测称 GPT-Images 2.5 对产品与品牌规范理解出色 — EXM7777 · 2026-09-12
- 一条 prompt 驱动全程追击戏:Seedance 2.5 实测 — azed_ai · 2026-09-12