字节推出 SeedRealtime 全双工模型,已上线豆包 App
aigclink · x · 2026-08-05
字节跳动发布原生音视频全双工大模型 SeedRealtime,原生融合音频、视频与文本三模态,能直接处理连续视频流,实现边看、边听、边说。
与 GPT-Live 的委派推理不同,SeedRealtime 将声音、画面、时序与表达纳入同一模型进行实时决策。感知、理解、决策与表达同步进行,使听觉和视觉信息共同参与每一次实时判断。这种机制让模型能结合当前画面、手势、视线与历史动作来理解代词(如“这个”)的具体指向,也能借助视觉场景对同音词或模糊语音进行消歧。
目前该模型已上线豆包 App,用户更新至最新版后通过打电话进入视频通话即可体验。
所属事件:字节发布 SeedRealtime 全双工模型(4 条相关)→
「多模态」频道最新
- Dreamina Seedance 2.5 全球上线,最低 $0.097/秒 — anthara_ai · 2026-08-05
- Krea 2 换脸实操痛点:如何解决皮肤蜡感与 CGI 痕迹? — Mysterious-Heart8909 · 2026-08-05
- AI 视频生成新演示:展现惊人想象力 — TheCultRustle · 2026-08-05
- AI 视频生成展示:绚丽烟花特效 — Successful-Age-5818 · 2026-08-05
- RTX 4070 本地跑 Minimax H3 视频生成,效果惊艳 — Athem · 2026-08-05
- AI 图像生成演示:九尾狐娘 — Rainsi_hk · 2026-08-05