StepAudio 3 发布技术报告:一个模型统一语音、音效与音乐生成

Bin Lin · hf · 2026-09-14

StepAudio 3 Gen 的技术报告已发布。这是一个离散自回归音频生成模型,使用残差向量量化(RVQ)token,在单一框架内统一了文本转语音、声音设计、音效生成和音乐生成等多种任务。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →