字节推原生音视频全双工大模型 SeedRealtime,已上线豆包

字节跳动Seed · wechat · 2026-08-05

字节跳动 Seed 团队正式发布原生音视频全双工大模型 SeedRealtime。该模型采用统一端到端架构,原生融合音频、视频与文本,突破了传统级联方案延迟高、信息损耗大的瓶颈,实现了“边看、边听、边说”的实时交互。

核心能力包括:

端到端人工评测显示,相比传统级联模型,其对话节奏问题减少了一半。目前该模型已在豆包 App 全量上线,用户更新至最新版即可通过“视频通话”功能体验。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →