字节发布 SeedAudio 1.0 并开放 API

字节跳动 Seed 团队发布音频创作模型 SeedAudio 1.0,并宣布火山引擎正式开放其 API 服务。该模型将音频生成能力从单一的要素产出推向了完整声音场景的统一创作,开发者可以直接接入使用。

核心能力与关键细节

SeedAudio 1.0 在统一框架下联合建模了人声、音效和环境声。在输入方面,模型支持文本提示词与参考音频的组合输入。在生成控制上,它具备 100ms 级别的时间控制精度,允许用户设定整段音轨长度并控制每句台词的时长。此外,模型单次可生成约 2 分钟的音频,并支持用一个提示词生成涵盖 20 种语言的富有表现力的语音。据智东西的实测分享,仅依靠场景描述,该模型就能生成具有剧情性的音频内容。

产品定位与影响

与传统的音频生成工具不同,BytePlus 在介绍中强调了 SeedAudio 1.0 的“导演级”控制体验。用户不再只是被动生成声音,而是可以精细地塑造音频细节。这种精准控时和多语种生成的结合,大幅降低了多语言音频内容编排的门槛。

2026-07-20 ~ 2026-07-21 · 5 条相关