字节推原生音视频全双工大模型 SeedRealtime,已上线豆包
字节跳动Seed · wechat · 2026-08-05
字节跳动 Seed 团队正式发布原生音视频全双工大模型 SeedRealtime。该模型采用统一端到端架构,原生融合音频、视频与文本,突破了传统级联方案延迟高、信息损耗大的瓶颈,实现了“边看、边听、边说”的实时交互。
核心能力包括:
- 音视频联合理解:深度融合声音、画面与时序信息,能结合视觉场景消解同音词歧义,准确理解指代关系。
- 主动交互:具备持续环境感知能力,能在画面状态变化(如特定目标出现)时主动提醒或介入。
- 流畅节奏:无需依赖外置 VAD 规则,能实时感知对话状态,自然处理接话、停顿,并具备较强抗干扰能力,能分辨旁人闲聊与背景噪声。
端到端人工评测显示,相比传统级联模型,其对话节奏问题减少了一半。目前该模型已在豆包 App 全量上线,用户更新至最新版即可通过“视频通话”功能体验。
「多模态」频道最新
- Seedance 误判频发,创作者呼吁 AI 公司停止过度审查 — TheChuckTone · 2026-08-05
- MiniMax H3 实测:结合 Krea 图像与 Gemini 提示词生成视频 — comfyui_user_999 · 2026-08-05
- Grok 4.5 结合 Blender MCP:用对话直接搭建 3D 场景 — elonmusk · 2026-08-05
- 单提示词生成1500+汽车零件:Opus模型硬核CAD实测 — mattshumer_ · 2026-08-05
- Grok Imagine Video 1.5 跃居图生视频榜眼 — elonmusk · 2026-08-05
- MiniMax H3 图生视频画质翻车?用户实测不如纯文生视频 — Naruwashi · 2026-08-05