仅40亿参数登顶开源榜,VideoChat3实现高效通用视频理解
jiqizhixin · x · 2026-07-31
南京大学、上海AI Lab等机构联合推出完全开源的视频多模态大模型 VideoChat3。该模型旨在高效处理从短视频片段到长达一小时流媒体的各种视频内容。
核心技术亮点:
- 采用 3D 视觉 Transformer(3D ViT)与自适应帧处理技术,显著降低计算开销,避免显存溢出。
- 在涵盖通用、长视频和流媒体内容的三个大规模精选数据集上进行了训练。
性能与开源情况:
- 模型参数量仅为 40 亿,但在通用、长视频和流媒体多项基准测试中,性能超越了同等或更大规模的开源模型。
- 实现全面开源,放出了完整的模型权重、训练代码和相关数据集。
「多模态」频道最新
- 创作者使用 Seedance 2.0 全程生成《Alligator》AI 音乐视频 — AIandDesign · 2026-07-31
- Higgsfield 预告 Seedance 2.5:AI 视频质量再破天花板 — hey_abusiddik · 2026-07-31
- Suno 推出 AI 封面图生成功能,支持多语言创作 — suno · 2026-07-31
- Mediabunny 更新双三次插值与 Mipmap,大幅提升视频缩放画质 — Vjeux · 2026-07-31
- 求助:ComfyUI 超宽图无损扩边与局部重绘工作流 — Tasty_Welcome_665 · 2026-07-31
- AI 生成 3D 动画:人物动作与微表情高度协调 — xiaohu · 2026-07-31