VideoChat3 发布 4B 开源视频模型,兼顾长视频与流式理解
机器之心 · wechat · 2026-07-22
4B 开源视频大模型 VideoChat3,把长视频和流式理解做进一个系统
南京大学、上海 AI Lab、南洋理工大学和北大团队发布了 VideoChat3,这是一个面向通用视频理解的 4B 参数多模态模型,主打“全面、高效、开源”。
架构上做了什么
- 用 I3D-ViT 把时序建模前移到视觉编码阶段,在语言模型之前就完成局部时空融合
- 为在线流式场景设计了 Silence / Standby / Response 三种状态,让模型判断何时继续观察、何时回答
- 目标是把短视频、长视频、在线视频三类任务统一到一个模型里
数据和训练
团队同时开放了三套数据:
- VideoChat3-Academic2M:约 227 万条学术视频问答/描述样本,答案被改写成带证据的自然语言
- VideoChat3-LV116K:约 11.6 万条长视频样本,带时间戳证据
- VideoChat3-OL617K:约 61.7 万条流式样本,训练模型“知道何时回答”
训练共分四阶段,累计使用 2500 万条样本。
结果
文章称,VideoChat3 在长视频理解、时序定位和流式理解等任务上表现有竞争力,并在长输入场景下显著降低延迟、FLOPs 和显存占用。项目做到了 数据、代码、权重全开源,适合研究和复现。
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27
- AMD R9700 开启动态 VRAM 后,LTX 2.3 生成速度大幅提升 — xdcfret1 · 2026-07-27