TLive-Omni:统一音视频图文的电商直播多模态理解模型

TaoLiveAIGC · hf · 2026-08-25

TLive-Omni 是一个面向电商直播的全模态理解模型。它通过带时间戳的 token 分组技术,统一处理图像、视频、音频和文本。模型采用阶段性监督训练和带有可验证反馈的强化微调,以实现对直播内容的精准实时理解。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →