SeedAudio1.0 统一生成音频场景
智东西 · wechat · 2026-07-20
字节跳动发布了 **SeedAudio1.0**,这是一个音频创作模型,主打从一段提示词直接生成完整声音场景,包含 **对白、音效和环境声**。 文章里的实测显示,它已经能做几件比较完整的事: - 只靠场景描述就生成有剧情感的音频 - 在长音频里保持角色音色一致 - 模仿参考音色,比如新闻联播女声风格 - 支持粤语等多语言输入 - 让台词、环境音和动作音效按时间线协同出现 官方给出的测试数据包括: - 盲测主观偏好分相较头部商用音频服务最高提升 **0.79 CMOS** - 在电影、短剧、播客、动画等十余类场景中,整体音频可用率达到 **91%** - 支持 **20+ 语言**,多数语言的自然度 **MOS 超过 4.0** 文章还强调了两个能力: 1. **多要素协同编排**:不用拼接多个工具,就能把角色语气、背景氛围和声音节奏组织成完整作品 2. **时间线控制**:支持约 **100ms** 级精度,更适合视频翻配、广告和内容创作 结论是,AI 音频正在从“会发声”走向“会创作”。
所属事件:字节发布 SeedAudio 1.0 并开放 API(5 条相关)→
「多模态」频道最新
- 图灵深视发布图灵鉴 X,做多模态商品评估 — 机器之心 · 2026-07-21
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21
- Reddit 实测:Krea 2 Turbo 用绕过 LoRA 找回表情能力 — YentaMagenta · 2026-07-21
- Suno v5.5、Reason Studios 和 Grok Imagine 拼出 AI 音乐梗作 — Kyrannio · 2026-07-21