TLive-Omni电商直播全模态理解模型开源

TLive-Omni 是面向电商直播的全模态理解模型,可同时处理图像、视频、音频和文本,实现边看边听边读,支持做笔记、找重点。技术方面,模型基于 Qwen3.5 骨干和 AuT 音频编码器,采用带时间戳的 token 分组技术,并通过阶段性监督训练和带可验证反馈的强化微调,支持高达 256K token 的上下文。该模型在直播电商任务及通用基准测试中均取得顶尖成绩。帖文中对其归属方存在阿里淘宝与字节跳动两种说法。

2026-08-25 ~ 2026-08-26 · 4 条相关

另有 1 条近重复转述:aigclink