阿里开源电商直播全模态模型TLive-Omni,支持256K上下文

aigclink · x · 2026-08-26

阿里淘宝开源了电商直播全模态理解模型TLive-Omni,可同时处理视频、音频、文本,实现边看边听边读,支持做笔记、找重点。该模型基于Qwen3.5骨干和AuT音频编码器,支持256K token上下文,能记住数小时直播内容。核心创新是Timestamped Per-vGrid token组织方式,将音频和视频token按时间网格对齐,解决声音与画面秒级对齐问题。模型具备语音识别、说话人识别、商品视觉定位、OCR、时序定位、视频密集描述、全模态问答、多维度镜头标注等能力,可应用于直播回放系统、直播复盘、内容切片等场景。

所属事件:TLive-Omni电商直播全模态理解模型开源(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →