VideoChat3 发布 4B 开源视频模型,兼顾长视频与流式理解

机器之心 · wechat · 2026-07-22

4B 开源视频大模型 VideoChat3,把长视频和流式理解做进一个系统

南京大学、上海 AI Lab、南洋理工大学和北大团队发布了 VideoChat3,这是一个面向通用视频理解的 4B 参数多模态模型,主打“全面、高效、开源”。

架构上做了什么

数据和训练

团队同时开放了三套数据:

训练共分四阶段,累计使用 2500 万条样本。

结果

文章称,VideoChat3 在长视频理解、时序定位和流式理解等任务上表现有竞争力,并在长输入场景下显著降低延迟、FLOPs 和显存占用。项目做到了 数据、代码、权重全开源,适合研究和复现。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →