SeedAudio1.0 统一生成音频场景
智东西 · wechat · 2026-07-20
字节跳动发布了 SeedAudio1.0,这是一个音频创作模型,主打从一段提示词直接生成完整声音场景,包含 对白、音效和环境声。
文章里的实测显示,它已经能做几件比较完整的事:
- 只靠场景描述就生成有剧情感的音频
- 在长音频里保持角色音色一致
- 模仿参考音色,比如新闻联播女声风格
- 支持粤语等多语言输入
- 让台词、环境音和动作音效按时间线协同出现
官方给出的测试数据包括:
- 盲测主观偏好分相较头部商用音频服务最高提升 0.79 CMOS
- 在电影、短剧、播客、动画等十余类场景中,整体音频可用率达到 91%
- 支持 20+ 语言,多数语言的自然度 MOS 超过 4.0
文章还强调了两个能力:
- 多要素协同编排:不用拼接多个工具,就能把角色语气、背景氛围和声音节奏组织成完整作品
- 时间线控制:支持约 100ms 级精度,更适合视频翻配、广告和内容创作
结论是,AI 音频正在从“会发声”走向“会创作”。
所属事件:字节发布 SeedAudio 1.0 并开放 API(5 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11