阶跃星辰连发五款 StepAudio3 模型,音频 AI 转向全栈体系竞争
新智元 · wechat · 2026-09-15
阶跃星辰 9 月 15 日一次性发布 StepAudio3 系列五款模型:TTS(语音生成)、Gen(完整音频生成)、Realtime(实时语音交互)、ASR(语音识别)和 Music(音乐创作),覆盖"听、说、理解、交互、创作"全链路,是国内首个以完整矩阵形态推出的音频模型系列。
三个 Artificial Analysis 榜单全球第一:Realtime 在对话节奏榜得 98.9%、语音推理榜 99.7%;ASR 词错误率仅 1.7%,接近专业速记员水平。其 ASR 采用声学建模结合 LLM 语境理解,支持方言、中英混说、耳语、唱歌等场景。
实测亮点:TTS 能自然还原迟疑、改口、笑声等副语言特征;Realtime 在一分钟内被连续打断四次仍能准确接续,工具调用与语音生成并行、不阻塞对话;Gen 可用一句 prompt 生成含人声、音效、环境音和配乐的完整场景,支持逐角色设定音色情绪并呈现连贯情绪弧线;Music 支持歌词成歌、纯音乐和干声智能配乐三条路径,可响应 G 小调 74BPM、指定配器与人声质感级别的精细制作指令,还能为一段清唱自动补齐编曲成完整作品。文章认为音频 AI 竞争正从单项能力赛转向全栈体系赛。
「多模态」频道最新
- Synthesia 推出 Avatar Builder,自定义形象几分钟生成视频 — synthesiaIO · 2026-09-15
- 用 Runway MCP 生成 30 秒照片级潜行游戏实机画面,完整 prompt 公开 — tlakomy · 2026-09-15
- AI 音乐视频评测新标准:别看首稿质量,要看修起来多容易 — Positive-Page1631 · 2026-09-15
- MiniMax H3 文生视频同 prompt 人脸趋同,WAN 表现更随机 — ThrowAwayBiCall911 · 2026-09-15
- MiniMax H3 脸部畸变修复:prompt 里加「人像距离锁」约束 — Devajyoti1231 · 2026-09-15
- GPT Image 2.5 实测:单参考图锁定角色,广告批量出图保持一致 — JaynitMakwana · 2026-09-15