阿里开源TLive-Omni:电商直播全模态理解模型,支持256K上下文
aigclink · x · 2026-08-26
阿里淘宝开源了电商直播全模态理解模型TLive-Omni,基于Qwen3.5骨干和AuT音频编码器,支持256K token上下文。模型采用Timestamped Per-vGrid布局,将音频和视频token按时间网格对齐,解决音画秒级对齐问题。具备语音识别、说话人识别、商品视觉定位、OCR、时序定位、视频密集描述、全模态问答、多维度镜头标注等能力。已发布4B和9B版本,技术报告已上线arXiv。可应用于直播回放系统、直播复盘、内容切片等场景。
所属事件:TLive-Omni电商直播全模态理解模型开源(4 条相关)→
「模型」频道最新
- GLM-5.3-Flash 火爆流量全靠国产芯片承载,且非最先进制程 — teortaxesTex · 2026-08-27
- Gemini Omni 1.1 Flash 现身 Google Cloud 配额,或 24 小时内发布 — koltregaskes · 2026-08-27
- 通义千问 Qwen3.8-Flash 上线 OpenRouter,支持长视频与多模态 — Alibaba_Qwen · 2026-08-27
- 趣评:量化版 Qwen 3.5 像个焦虑小人 — arthurcolle · 2026-08-27
- Ox Alpha身份揭晓:智谱GLM-5.3-Flash,全程国产芯片训练 — eyishazyer · 2026-08-27
- GLM-5.3 Flash 登顶 OpenRouter,纯国产芯仅需 1% 价格 — jietang · 2026-08-27