VideoChat3 发布 4B 开源视频模型,兼顾长视频与流式理解
机器之心 · wechat · 2026-07-22
4B 开源视频大模型 VideoChat3,把长视频和流式理解做进一个系统
南京大学、上海 AI Lab、南洋理工大学和北大团队发布了 VideoChat3,这是一个面向通用视频理解的 4B 参数多模态模型,主打“全面、高效、开源”。
架构上做了什么
- 用 I3D-ViT 把时序建模前移到视觉编码阶段,在语言模型之前就完成局部时空融合
- 为在线流式场景设计了 Silence / Standby / Response 三种状态,让模型判断何时继续观察、何时回答
- 目标是把短视频、长视频、在线视频三类任务统一到一个模型里
数据和训练
团队同时开放了三套数据:
- VideoChat3-Academic2M:约 227 万条学术视频问答/描述样本,答案被改写成带证据的自然语言
- VideoChat3-LV116K:约 11.6 万条长视频样本,带时间戳证据
- VideoChat3-OL617K:约 61.7 万条流式样本,训练模型“知道何时回答”
训练共分四阶段,累计使用 2500 万条样本。
结果
文章称,VideoChat3 在长视频理解、时序定位和流式理解等任务上表现有竞争力,并在长输入场景下显著降低延迟、FLOPs 和显存占用。项目做到了 数据、代码、权重全开源,适合研究和复现。
「多模态」频道最新
- Seedance 2.0 的 15 秒孟买雨季电影提示词 — CurieuxExplorer · 2026-07-22
- 跨语种 TTS 克隆难保动漫角色声线 — WowSkaro · 2026-07-22
- Claude Mythos 和 gptimage 做出万圣节感混搭神曲 — repligate · 2026-07-22
- Stable Diffusion 3.5 仍是写实图首选 — CheezyWookiee · 2026-07-22
- Image MCP Server 把图像生成接入 agent 工作流 — modelcontextprotocol · 2026-07-22
- AI 互动剧情游戏把《奥德赛》做成可玩分支故事 — vista8 · 2026-07-22