字节发布原生全双工模型 SeedRealtime
字节跳动 Seed 团队正式发布原生音视频全双工大模型 SeedRealtime,对标 GPT Live。该模型现已全量上线豆包 App,用户更新至最新版即可免费体验实时视频聊天功能。这标志着 AI 交互正式向宛如真人在场的实时全双工交互迈出重要一步。
已确认
- 模型架构:SeedRealtime 采用统一端到端架构,原生融合音频、视频与文本三模态。相比以往依赖级联系统或纯语音端到端模型,新架构有效突破了延迟高、信息损耗大的瓶颈。
- 交互能力:模型能够直接处理连续视频流,实现“边看、边听、边说”的实时交互。其核心突破在于模型能自主判断对话节奏,无需用户手动控制开闭麦,甚至可在用户开口前主动介入响应。
- 场景表现:模型具备视觉和听觉多重注意力机制,可自动过滤背景杂音。在多人聚餐等复杂场景演示中,能准确将名字与人物对应。据 @vista8 实测,该模型视觉理解能力强,能准确识别视频中一闪而过的人物与图表并给出完整解读。
- 技术对比:据 @aigclink 分析,与 GPT-Live 的委派推理不同,SeedRealtime 将声音、画面、时序与表达统一交由同一模型处理,从而更精准地判断对话状态。
为什么重要
该模型标志着字节跳动在实时多模态交互领域的正式落地。通过免费内置于国民级应用豆包 App 中,大幅降低了用户体验前沿全双工音视频交互的门槛。
2026-08-05 ~ 2026-08-06 · 9 条相关
一手来源
- 字节推原生音视频全双工大模型 SeedRealtime,已上线豆包 — 字节跳动Seed ·
- 字节发布 SeedRealtime 模型,豆包 App 免费开启实时视频聊天 — xiaohu ·
- 豆包视频通话大升级:原生全双工模型 SeedRealTime 上线 — vista8 ·
- 【源头】字节推原生音视频全双工大模型 SeedRealtime,已上线豆包 — 字节跳动Seed · 2026-08-05
- 【源头】字节发布 SeedRealtime 模型,豆包 App 免费开启实时视频聊天 — xiaohu · 2026-08-05
- 豆包全量上线 SeedRealtime:原生全双工边看边聊免费开放 — xiaohu · 2026-08-05
- 字节跳动发布全双工实时AI模型SeedRealtime — CurieuxExplorer · 2026-08-05
- 字节发布 SeedRealtime:原生音视频全双工大模型 — iamrobotbear · 2026-08-06
- 【源头】豆包视频通话大升级:原生全双工模型 SeedRealTime 上线 — vista8 · 2026-08-06
另有 3 条近重复转述:aigclink · testingcatalog · vista8