VideoChat3 发布 4B 开源视频模型,兼顾长视频与流式理解
机器之心 · wechat · 2026-07-22
4B 开源视频大模型 VideoChat3,把长视频和流式理解做进一个系统
南京大学、上海 AI Lab、南洋理工大学和北大团队发布了 VideoChat3,这是一个面向通用视频理解的 4B 参数多模态模型,主打“全面、高效、开源”。
架构上做了什么
- 用 I3D-ViT 把时序建模前移到视觉编码阶段,在语言模型之前就完成局部时空融合
- 为在线流式场景设计了 Silence / Standby / Response 三种状态,让模型判断何时继续观察、何时回答
- 目标是把短视频、长视频、在线视频三类任务统一到一个模型里
数据和训练
团队同时开放了三套数据:
- VideoChat3-Academic2M:约 227 万条学术视频问答/描述样本,答案被改写成带证据的自然语言
- VideoChat3-LV116K:约 11.6 万条长视频样本,带时间戳证据
- VideoChat3-OL617K:约 61.7 万条流式样本,训练模型“知道何时回答”
训练共分四阶段,累计使用 2500 万条样本。
结果
文章称,VideoChat3 在长视频理解、时序定位和流式理解等任务上表现有竞争力,并在长输入场景下显著降低延迟、FLOPs 和显存占用。项目做到了 数据、代码、权重全开源,适合研究和复现。
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11