阶跃星辰连发五款 StepAudio3 模型,音频 AI 转向全栈体系竞争

新智元 · wechat · 2026-09-15

阶跃星辰 9 月 15 日一次性发布 StepAudio3 系列五款模型:TTS(语音生成)、Gen(完整音频生成)、Realtime(实时语音交互)、ASR(语音识别)和 Music(音乐创作),覆盖"听、说、理解、交互、创作"全链路,是国内首个以完整矩阵形态推出的音频模型系列。

三个 Artificial Analysis 榜单全球第一:Realtime 在对话节奏榜得 98.9%、语音推理榜 99.7%;ASR 词错误率仅 1.7%,接近专业速记员水平。其 ASR 采用声学建模结合 LLM 语境理解,支持方言、中英混说、耳语、唱歌等场景。

实测亮点:TTS 能自然还原迟疑、改口、笑声等副语言特征;Realtime 在一分钟内被连续打断四次仍能准确接续,工具调用与语音生成并行、不阻塞对话;Gen 可用一句 prompt 生成含人声、音效、环境音和配乐的完整场景,支持逐角色设定音色情绪并呈现连贯情绪弧线;Music 支持歌词成歌、纯音乐和干声智能配乐三条路径,可响应 G 小调 74BPM、指定配器与人声质感级别的精细制作指令,还能为一段清唱自动补齐编曲成完整作品。文章认为音频 AI 竞争正从单项能力赛转向全栈体系赛。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →