TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun Liu, Meiguang Jin, Junfeng Ma
cs.AI, cs.CV
2026-08-21
阿里淘宝的TLive-Omni把Qwen3-Omni音频编码器接到Qwen3.5上,用Per-vGrid把每个视频格和同时段音频绑在一起,再用Faithful-RFT直接打最终答案。4B商品图定位AP 91.45,9B直播ASR的CER降到6.46。
电商直播里,一件商品的关键信息散落在不同通道:主播口播品牌和尺码,画面里出现实物和模特,角落叠着价格条和优惠券,弹幕还在追问库存。证据还经常对不齐,口播说「这款」时,镜头可能已经切走。
通用全模态模型能同时吃图、视频和音频,但训练和评测并不围着「货」转。MiniCPM-o 4.5、Qwen3-Omni、OmniVinci、Nemotron 3 Nano Omni 都是开放域交互;字节 Valley3 往电商靠了一步,仍没有按直播原子能力拆开。TLive-Omni 来自阿里巴巴淘天集团,目标很窄:把一场嘈杂、很长的直播流听懂、看懂,并且答得跟证据对齐。
底座是 Qwen3.5,只出文本,上下文到 256K。视觉走原生 Qwen3.5 管线,空间合并后一张图是 (h/32)×(w/32) 个 token。音频不走外挂 ASR:直接接入 Qwen3-Omni 的 AuT 编码器(约 2000 万小时音频上训出来的),16 kHz、128 维 mel,大约每秒压成 13 个 token,再经两层 aligner 投进语言模型。外挂转写会丢掉音画时间对应和说话人线索,所以音频被当成一等输入。
核心组织方式叫 Per-vGrid。每个视频时间格和同一时段的音频被包进同一段,前后加边界 token,并写上按实际采样帧算出来的时间戳。相对 Qwen3-Omni 的音画拼接,这里多了显式时间戳、格边界,以及格内音画必须相邻。请求 2 FPS 不等于真抽到 2 FPS:119 帧、30 FPS 的片按 2 FPS 去抽,实际可能落到约 1.76 FPS,一个格大约 1.13 秒而不是 1 秒,音频 token 从约 13 个变成 14-15 个。时间戳跟着真实采样走,音画才对得上。
监督分三阶段。第一阶段冻住语言模型和音频编码器,只训 aligner,5M 条 ASR。第二阶段放开音频编码器和 aligner,语言模型仍冻,26M 条 ASR、音频描述和音频问答。第三阶段联合微调 14M 条多模态样本,冻住音视觉编码器,只动 aligner 和语言模型,覆盖转写、说话人、商品定位、OCR、时间定位、稠密描述和全模态问答。
后面再加 Faithful-RFT:用 GRPO,每条 prompt 滚 8 个候选,用任务可核验的奖励直接打最终答案,并且压掉显式 think 标签。直播要的是忠于证据、尽快给出答案,不给推理长度发奖。奖励按任务路由:选择题、框、OCR 走规则,开放题走 LLM judge,格式约束只用来禁 think 标签。组内奖励方差接近零时重新采样,避免 GRPO 没有相对优势。异构长度则用同步按长度分组的采样器,减 padding,同时让各 worker 负载接近。
数据侧按音频、图像、视频分路造。音频用多 ASR 投票加关键词词表;说话人用纯音频 diarization 和多模态预测做 IoU 对账,对不上再看口型。图像商品框走 Detector-Judger 循环。视频先按镜头切再稠密描述,问答和时间定位则按语义事件切。
直播域评测是淘天内部套件。音频上,TLive-Omni-9B 的 CER 是 6.46,4B 是 6.66,均低于开源的 Qwen3-Omni 30B-A3B(6.75)和闭源的 Gemini 3.5 Flash(13.09)。说话人转写 cpWER,9B 为 12.27,Qwen3-Omni 是 27.84。音频描述准确率约 76,仍低于 Gemini 3 Pro 的 85.07。
图像侧差距更大。商品图定位 [email protected],4B 91.45、9B 89.96,Qwen3-Omni 68.88,Gemini 3.5 Flash 74.89。直播画面定位 4B 82.85,贴近 Gemini 3.5 Flash 的 84.15。OCR 定位 F1 约 87,识别 NED 4B 4.72、9B 4.24,分类准确率约 80,这三项都压过参与对比的开源和闭源模型。
视频时间定位 mIoU,9B 81.49,Gemini 3 Pro 77.90,Qwen3-Omni 只有 39.22。稠密描述准确率 9B 74.63,幻觉率 8.76,对照 Gemini 2.5 Flash 的 54.60 / 10.97。视频问答 9B 93.23,略高于 Gemini 2.5 Pro 的 92.62。
通用榜没有被垂直化打穿。9B 在 MMBench 88.9、MLVU 80.9、Video-MME 75.6、LongVideoBench 69.9 上是开源第一档;4B 在 TimeLens 三个子集的 mIoU(57.0 / 58.2 / 69.2)和 VideoMMMU 73.9 上反而超过 9B。全模态 AVUT 上 9B 80.0,高于 MiniCPM-o 4.5 的 78.6 和 Qwen3-Omni 的 74.2。
| 任务 | TLive-Omni-4B | TLive-Omni-9B | 对照 |
| 直播 ASR CER ↓ | 6.66 | 6.46 | Qwen3-Omni 6.75 |
| 商品图 [email protected] ↑ | 91.45 | 89.96 | Gemini 3.5 Flash 74.89 |
| 直播时间定位 mIoU ↑ | 77.63 | 81.49 | Gemini 3 Pro 77.90 |
| Video-MME ↑ | 71.3 | 75.6 | MiniCPM-o 4.5 70.4 |
这是一份把架构、数据、训练目标和评测全部钉在直播电商上的垂直全模态方案,不是再发一个通用 Omni。商品图定位、价格条 OCR、SKU 口播转写这类任务,开源通用模型离可用还差一截,TLive-Omni 把差距拉到了可以上业务的量级。4B 和 9B 权重已经放到 Hugging Face。
Faithful-RFT 的取舍也清楚:直播理解要的是可核验的最终答案和低延迟,不给思维链发奖。同步长度分组采样和零方差重采,是把 GRPO 跑在异构多模态数据上的工程细节,别的垂直场景可以抄。
但它是理解模型,不会说话、不会全双工。要做直播助手,还得另接生成和交互。
作者写明:只做理解,不做生成或全双工实时交互;公开榜覆盖还要加;更长、更吵、更杂的直播流稳定性不足;证据残缺时的时间校准仍弱。
直播域数字全部来自内部套件,外界无法复现。4B 在商品图 AP、HallusionBench、TimeLens、VideoMMMU 上超过 9B,可能是评测噪声,也可能是小模型在垂直数据上更容易贴任务。MMMU 上 9B 得 73.4,略低于底座 Qwen3.5-9B 的 74.2;SimpleVQA 50.0,和 Gemini 3 Pro 的 73.2 差一截。压掉 think 痕迹,难推理题可能就是这样的代价。音频描述仍明显落后 Gemini 3 Pro。镜头理解的构图维度,Gemini 2.5 Pro 仍更高。
数据引擎和内部评测集没有作为可复现资产放出。现在能确认的是:在淘天自己的尺子上,垂直化打赢了通用 Omni;尺子本身偏不偏,还看不到。