豆包上线全模态全双工大模型,视频通话交互超越 GPT Live?
vista8 · x · 2026-08-06
字节跳动旗下豆包 App 近期全量上线了基于原生音视频全双工大模型 SeedRealtime 的视频通话功能。该模型将声音、画面、时序与表达纳入同一模型进行实时决策,实现了视频、音频、文本的全模态全双工交互。
技术突破与体验
- 打破传统级联延迟:现有方案多为 ASR、VLM、TTS 多模块级联或依赖外置 VAD 的半双工,而 SeedRealtime 实现了感知、理解、决策与表达同步进行。
- 视觉消除歧义:当用户说“这个怎么弄”等指代词时,模型能结合画面、手势、视线及历史操作判断具体指向。
- 实测表现:在测试中,模型能成功识别 YouTube 视频中一闪而过的画面人物并解读图表。相比 OpenAI GPT Live 仅支持音频全双工,SeedRealtime 延迟更低、语音更自然,且无翻译腔。
用户只需将豆包 App 更新至最新版,点击“打电话”图标并开启摄像头即可体验,无需申请内测。
所属事件:字节发布全双工模型 SeedRealtime,豆包免费开放(9 条相关)→
「模型」频道最新
- 海外开发者寻求合规托管 GLM 与 Kimi 大模型的西方平台 — sgt102 · 2026-08-06
- DeepSeek API 被曝内置联网搜索:无需第三方接口即可调用 — max_paperclips · 2026-08-06
- MiniMax-H3 实验性模型登顶 Hugging Face 热门榜 — Kijai · 2026-08-06
- 阿里发布Qwen3.8 Max:2.4T参数MoE,性能比肩Claude Opus — ArtificialAnlys · 2026-08-06
- Alexandr Wang 惊叹:Muse Spark 1.2 展现出前所未见的能力 — alexandr_wang · 2026-08-06
- MiniMax H3 霸榜视频生成,开源权重再超闭源 — airesearch12 · 2026-08-06