阿里开源电商直播全模态模型TLive-Omni,支持256K上下文
aigclink · x · 2026-08-26
阿里淘宝开源了电商直播全模态理解模型TLive-Omni,可同时处理视频、音频、文本,实现边看边听边读,支持做笔记、找重点。该模型基于Qwen3.5骨干和AuT音频编码器,支持256K token上下文,能记住数小时直播内容。核心创新是Timestamped Per-vGrid token组织方式,将音频和视频token按时间网格对齐,解决声音与画面秒级对齐问题。模型具备语音识别、说话人识别、商品视觉定位、OCR、时序定位、视频密集描述、全模态问答、多维度镜头标注等能力,可应用于直播回放系统、直播复盘、内容切片等场景。
所属事件:TLive-Omni电商直播全模态理解模型开源(4 条相关)→
「模型」频道最新
- 智谱GLM-5.3模型权重将于明日发布 — serige · 2026-08-27
- TokenSpeed 首日支持 Qwen 3.8 Flash Next — Alibaba_Qwen · 2026-08-27
- AI 互相对话时的创造力远超面对用户时的表现 — nabeelqu · 2026-08-27
- Claude Code 新版本体积缩减 45% — jarredsumner · 2026-08-27
- OpenRouter 榜单:真金白银的消耗数据优于自媒体吹嘘 — sujingshen · 2026-08-27
- Qwen 3.8-Next 发布,技术报告详解架构与预训练 — nrehiew_ · 2026-08-27