SeedAudio1.0 统一生成音频场景

智东西 · wechat · 2026-07-20

字节跳动发布了 **SeedAudio1.0**,这是一个音频创作模型,主打从一段提示词直接生成完整声音场景,包含 **对白、音效和环境声**。 文章里的实测显示,它已经能做几件比较完整的事: - 只靠场景描述就生成有剧情感的音频 - 在长音频里保持角色音色一致 - 模仿参考音色,比如新闻联播女声风格 - 支持粤语等多语言输入 - 让台词、环境音和动作音效按时间线协同出现 官方给出的测试数据包括: - 盲测主观偏好分相较头部商用音频服务最高提升 **0.79 CMOS** - 在电影、短剧、播客、动画等十余类场景中,整体音频可用率达到 **91%** - 支持 **20+ 语言**,多数语言的自然度 **MOS 超过 4.0** 文章还强调了两个能力: 1. **多要素协同编排**:不用拼接多个工具,就能把角色语气、背景氛围和声音节奏组织成完整作品 2. **时间线控制**:支持约 **100ms** 级精度,更适合视频翻配、广告和内容创作 结论是,AI 音频正在从“会发声”走向“会创作”。

所属事件:字节发布 SeedAudio 1.0 并开放 API(5 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →