字节跳动发布 SeedRealtime 全双工音视频大模型
testingcatalog · x · 2026-08-05
字节跳动 Seed 团队正式推出了 SeedRealtime,一款原生音视频全双工大语言模型。该模型采用统一架构,能够同时处理连续的音频、视频和文本流,实现“边看、边听、边说”的实时交互。
核心突破在于模型能够自主判断对话时机,摆脱了对外部语音活动检测(VAD)规则的依赖。它可以追踪场景、识别说话人、理解停顿和背景噪音,并能结合视觉上下文消除语音歧义。在嘈杂的餐厅或多人聚餐等开放场景测试中,模型展现了精准的人脸、声音匹配与物品识别能力,甚至在检测到特定物体出现时能主动发起提醒。
所属事件:字节发布全双工模型 SeedRealtime 并上线豆包(5 条相关)→
「模型」频道最新
- Ilya 新创公司 SSI 本月或将发布首款模型 — haider1 · 2026-08-05
- 实测 AI 文本检测:Pangram 零误报,但难挡现代 LLM — FlorianGallwitz · 2026-08-05
- Kimi 被视作新 Claude,月之暗面成新 Anthropic — EXM7777 · 2026-08-05
- 研究称 Claude Opus 5 狂爱用 silently 和 load-bearing — JeremyNguyenPhD · 2026-08-05
- Liquid AI 联手 MacPaw,为数百万 Mac 用户带来端侧 AI 助手 — TheZachMueller · 2026-08-05
- 别神化未发布模型,GPT Image 2已具备高质量出图能力 — Angaisb_ · 2026-08-05