字节推出 SeedRealtime 全双工模型,已上线豆包 App

aigclink · x · 2026-08-05

字节跳动发布原生音视频全双工大模型 SeedRealtime,原生融合音频、视频与文本三模态,能直接处理连续视频流,实现边看、边听、边说。

与 GPT-Live 的委派推理不同,SeedRealtime 将声音、画面、时序与表达纳入同一模型进行实时决策。感知、理解、决策与表达同步进行,使听觉和视觉信息共同参与每一次实时判断。这种机制让模型能结合当前画面、手势、视线与历史动作来理解代词(如“这个”)的具体指向,也能借助视觉场景对同音词或模糊语音进行消歧。

目前该模型已上线豆包 App,用户更新至最新版后通过打电话进入视频通话即可体验。

所属事件:字节发布 SeedRealtime 全双工模型(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →