边说边看:复旦 MOSS-VL 用门控交叉注意力让视觉模型在生成中不瞎

MOSS-VL Technical Report

Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen, Xingyang He, Huazheng Zeng, Jijun Cheng, Chenghao Wang, Xiaomeng Qian, Pengfei Wang, Zhan Huang, Shanqing Gao, Wei Huang, Longjun Cao, Wu Ran, Jie Liu, Changtai Zhu, Hongkai Wang, Yixian Tian, Chenghao Liu, Zhen Ye, Xinghao Wang, Botian Jiang, Guoguo Feng, Zhaoye Fei, Ruixiao Li, Mingshu Chen, Yang Gao, Qinyuan Cheng, Shimin Li, Xipeng Qiu

cs.CV

2026-08-15

11.3B 开源视觉语言模型把「边生成边感知」做进架构:视觉 token 不进解码序列、只走门控交叉注意力,新帧到达只追加缓存;主动告警子集 66.0 对 37.5 碾压开源流式基线,同底座对比 Qwen3-VL-8B 首 token 延迟优势随视觉上下文从 2.8 倍拉到 5.1 倍。

这篇在解决什么

开源视频理解模型基本是离线的:看完整个片段再答题。真实场景不等人:直播解说要随时开口,条件告警要在事件发生的那一秒说话,说话的时候画面还在走。现有流式模型(L2-L4 级)解决了持续输入、该沉默时沉默、持续追问,但都有一个共同缺陷:生成回复期间是瞎的,新帧进不来,说错了也没法当场改。论文给能力分了五级,真正的实时交互是 L5:边生成边感知,证据一变就修正或掐断自己的话。

难点在主流架构:视觉 token 拼进文本序列一起自回归,生成中每来一帧就要重算 KV 缓存,解码状态被持续打断。

方法

MOSS-VL(Qwen3-8B 做语言底座,共 11.3B 参数)的答案是把视觉彻底挪出解码路径:

训练是四阶段预训练(共约 1.26 万亿 token,序列从 8K 拉到 256K,大规模合成 caption/OCR/定位/时序定位数据打底)加 SFT 出 MOSS-VL-Instruct,最后一个轻量的 Realtime-SFT 阶段(348 亿 token,不到总量的 3%)装进全部实时行为:只加两个状态 token(<|silence|> 和 <|response|>),每个帧后一个决策槽,说或等就是普通的下一 token 预测,不需要专门的决策头。250 万次发言决策里 58.7% 是自主定时而非被用户问话,5.1% 的样本正确答案是全程沉默。类别不均衡用 focal 加逆频率权重压平;流式场景下连回合结束 token 都不监督,免得模型学会「新用户回合来了就收尾」,这一项让发言频率提升 39%、平均回复变长 68%。整套东西靠一个共享系统提示词在离线/流式/实时三模式间切换,权重一套,架构零改动。

结果

流式侧对四个 benchmark,开源流式模型里三个拿平均第一(OVO-Bench 70.2 对 65.3,OmniMMI 32.7 对 25.4,ProactiveVideoQA 47.2 对 42.7),StreamingBench 视觉组 69.7 排第二(AURA 71.1)。差异集中在哪里才是重点:

主动行为子集MOSS-VL-Realtime最强基线
OmniMMI 主动告警 PA66.037.5(AURA)
StreamingBench 主动输出 PO60.053.2(AURA)
OVO-Bench 前向主动应答 FAR62.155.8(AURA)
OVO-Bench 回溯追踪 BT72.660.4(AURA)

三个直接考「该不该现在开口」的子集全部第一,退化成当前场景感知问答的子集上 AURA 仍领先。

效率在 SGLang、单张 H200、BF16 下实测(不是估算):与共用 Qwen3-8B 底座的 Qwen3-VL-8B 比,ViT 输出对齐时首 token 延迟优势从 2.8 倍随视觉上下文增长拉到 5.1 倍,端到端从 1.9 倍到 4.3 倍。同视频同帧数的对比更苛刻:MOSS-VL 放弃时间维压缩、带约两倍视觉 token,依然全程不落后。

离线侧 MOSS-VL-Instruct 在 39 个 benchmark 上与同规模开源模型互有胜负:感知块 12 项拿 5 项(BLINK 78.0 领先 8.9 分),时序推理视频集 Minerva(40.5)、TOMATO(39.5)、VideoMME-Logical(17.1)全部第一;MMMU、文档类、常规定位(RefCOCO-REC)落后,作者归因于没做思考模式、训练目标是实时视频而非考试型推理。

为什么重要

对做视频交互产品的人,这是第一个把 L5 行为连同权重、训练课程表、实时推理代码、改造过的 FlashAttention-3 后端一起开源的全栈参考实现。架构层面的教训可迁移:任何需要「生成中持续接入新模态输入」的场景(语音流、传感器流、日志流),把模态 token 挡在解码序列外、走追加式交叉注意力缓存,延迟随上下文的增长曲线立刻变平。Realtime-SFT 的做法也省:两个词表条目加一个损失重加权就把交互行为装进去,不需要 RL、不需要新头。

主动告警 66.0 对 37.5 的差距说明「何时开口」是被直接监督出来且可教的,不是模型规模的副产品。

局限与存疑

作者自列:MMMU 和文档类 benchmark 落后于同规模最强开源模型,没有思考模式;核心卖点 L5(生成中感知、当场改口)目前只有定性演示和发布的实时推理代码,量化验证停在 L2-L4,因为公共 benchmark 到 L4 为止,领域还缺一个测「生成中感知」的基准;RL 后训练在路线图上但没做。

读下来的补充:流式对比的基线数字大多取自各家官方报告,推理设置(尤其帧数)未必与 MOSS-VL 对齐,论文自己承认这点,交叉模型读分要留心;11.3B 对 7-8B 级基线的参数对比靠「额外参数不在解码序列里」来辩护,语言底座确实同级,但视觉编码器和交叉注意力栈的容量差仍是不对齐因素;合成交互语料来自 caption 驱动管线,时序锚点是逐帧核验过的,但「改口」行为的真实性(相对真实多模态对话)没有外部验证。

术语

原文与代码

相关论文

全部论文解读