腾讯发布统一语音模型 AuK:TTS 与指令编辑一网打尽,Flash 快 4.5 倍
_akhaliq · x · 2026-09-10
腾讯发布 AuK,一个统一的语音生成与编辑模型:支持零样本 TTS、基于自然语言指令的内容/声学/副语言编辑,还集成了语音增强与分离,全部通过同一个自然语言接口完成。
蒸馏版本 AuK-Flash 运行速度提升 4.5 倍。
「多模态」频道最新
- GPT Image 2.5 登陆 OpenArt:Flare 与 Sunburst 双模式 — OpenAIDevs · 2026-09-10
- Minimax Studio 演示:ComfyUI 本地后端驱动的视频制作 — Wild_Ant5693 · 2026-09-10
- 开源 Minimax Studio:ComfyUI 本地后端一体化视频工作台 — Wild_Ant5693 · 2026-09-10
- ComfyUI 实测:MiniMax H3 生成动态壁纸全流程分享 — alisitskii · 2026-09-10
- 统一自编码论文 The Prism Hypothesis 入选 ECCV 2026,为无编码器 MLLM 铺路 — liuziwei7 · 2026-09-10
- 张一鸣亲自督导,字节押注 Seedance 切入实时世界模型 — 创业邦 · 2026-09-10