全开源视频多模态模型 VideoChat3

MCG-NJU · hf · 2026-07-17

VideoChat3 被介绍为一个 完全开放、效率更高、通用性更强 的视频 MLLM。

主要目标

现有开源视频模型常见问题是:

方法设计

作者从两个方向改进:

1) 提升效率

2) 提升效果

构建了一个可扩展的视频数据合成流水线,整理出三套训练集:

覆盖通用、长视频和流式视频三类场景。

结果

在通用、长视频和流式视频基准上,VideoChat3 以 4B 参数 达到比之前同规模甚至更大规模的开源模型更好的效果,并且效率更高。

所属事件:全开源视频多模态模型 VideoChat3 发布(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →