微软在 Hugging Face 发布 Mage-VL,主打流式图像和视频理解

_akhaliq · x · 2026-07-28

微软在 Hugging Face 上发布了 Mage-VL,定位为一个 codec-native、支持主动流式处理的多模态基础模型,主要用于 图像和视频理解。

配图展示的是一个“事件触发式解说”结构:先由 gate predictor 判断是否需要发声,只有在门控打开时才由 LLM decoder 生成文字/语音评论;视觉侧由 Mage-ViT 提供共享特征,并对连续直播画面流做选择性解说。

整体看,这不是普通的离线视频字幕模型,而是面向流式多模态理解与实时输出的方案。

所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →