全开源视频多模态模型 VideoChat3
MCG-NJU · hf · 2026-07-17
VideoChat3 被介绍为一个 完全开放、效率更高、通用性更强 的视频 MLLM。
主要目标
现有开源视频模型常见问题是:
- 泛化能力有限,只在少数场景好用
- 计算开销高,难以扩展
- 只部分开放,训练代码/策略/数据集不全,影响复现
方法设计
作者从两个方向改进:
1) 提升效率
- 引入 Inflated 3D Vision Transformer (I3D-ViT)
- 采用 Adaptive Frame Resolution 做流式视频感知
- 降低训练和推理时处理视频输入的成本
2) 提升效果
构建了一个可扩展的视频数据合成流水线,整理出三套训练集:
- VideoChat3-Academic2M
- VideoChat3-LV116K
- VideoChat3-OL617K
覆盖通用、长视频和流式视频三类场景。
结果
在通用、长视频和流式视频基准上,VideoChat3 以 4B 参数 达到比之前同规模甚至更大规模的开源模型更好的效果,并且效率更高。
所属事件:全开源视频多模态模型 VideoChat3 发布(3 条相关)→
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11