阿里开源TLive-Omni:电商直播全模态理解模型,支持256K上下文

aigclink · x · 2026-08-26

阿里淘宝开源了电商直播全模态理解模型TLive-Omni,基于Qwen3.5骨干和AuT音频编码器,支持256K token上下文。模型采用Timestamped Per-vGrid布局,将音频和视频token按时间网格对齐,解决音画秒级对齐问题。具备语音识别、说话人识别、商品视觉定位、OCR、时序定位、视频密集描述、全模态问答、多维度镜头标注等能力。已发布4B和9B版本,技术报告已上线arXiv。可应用于直播回放系统、直播复盘、内容切片等场景。

所属事件:TLive-Omni电商直播全模态理解模型开源(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →