TLive-Omni电商直播全模态理解模型开源
TLive-Omni 是面向电商直播的全模态理解模型,可同时处理图像、视频、音频和文本,实现边看边听边读,支持做笔记、找重点。技术方面,模型基于 Qwen3.5 骨干和 AuT 音频编码器,采用带时间戳的 token 分组技术,并通过阶段性监督训练和带可验证反馈的强化微调,支持高达 256K token 的上下文。该模型在直播电商任务及通用基准测试中均取得顶尖成绩。帖文中对其归属方存在阿里淘宝与字节跳动两种说法。
2026-08-25 ~ 2026-08-26 · 4 条相关
- TLive-Omni:统一音视频图文的电商直播多模态理解模型 — TaoLiveAIGC · 2026-08-25
- 字节跳动 TLive-Omni 全模态电商直播模型发布 — _akhaliq · 2026-08-25
- 阿里开源电商直播全模态模型TLive-Omni,支持256K上下文 — aigclink · 2026-08-26
另有 1 条近重复转述:aigclink