字节跳动发布 SeedRealtime 全双工音视频大模型

testingcatalog · x · 2026-08-05

字节跳动 Seed 团队正式推出了 SeedRealtime,一款原生音视频全双工大语言模型。该模型采用统一架构,能够同时处理连续的音频、视频和文本流,实现“边看、边听、边说”的实时交互。

核心突破在于模型能够自主判断对话时机,摆脱了对外部语音活动检测(VAD)规则的依赖。它可以追踪场景、识别说话人、理解停顿和背景噪音,并能结合视觉上下文消除语音歧义。在嘈杂的餐厅或多人聚餐等开放场景测试中,模型展现了精准的人脸、声音匹配与物品识别能力,甚至在检测到特定物体出现时能主动发起提醒。

所属事件:字节发布全双工模型 SeedRealtime 并上线豆包(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →