微软发布 4B 流式多模态模型 Mage-VL
微软发布了 Mage-VL,一款 4B 参数的 codec-native 流式多模态基础模型,面向实时图像与视频理解及交互。微软称其核心 tokenizer“Mage-ViT”可在流式多模态任务中减少 75% 视觉 token;转述帖还将其概括为可带来 3.5 倍推理提速。结合多条帖子来看,这个模型主打“边看边理解”,并支持用自然语言指定要重点关注的时刻或事件。
已确认
- 微软将 Mage-VL 描述为面向实时理解与交互的 codec-native streaming multimodal foundation model。
- 多条帖子把 Mage-VL 描述为 4B 参数模型,定位是高效的图像与视频理解。
- 微软确认其核心组件是自定义视觉 tokenizer“Mage-ViT”。转述帖称,这一路线不再对每一帧做同等编码,而是借鉴视频编解码器的 I/P 帧思路,保留锚点帧并压缩其余视觉信息。
- 微软给出的结果是:Mage-VL 在流式多模态任务中可减少 75% 视觉 token。
- 多条转述帖称,Mage-VL 支持“边看边说”式的视频理解,用户还能用自然语言指定自己关心的时间点、片段或事件。
- @pmttyji 的转述补充称,其视觉编码器为从零训练;转述帖还将模型概括为可实现 3.5 倍推理提速。
为什么重要
- 多模态模型处理连续视频时,常见瓶颈就是视觉 token 开销和响应时延。Mage-VL 的卖点正是用更少 token 处理流式图像与视频,目标直指实时场景。
- 如果微软给出的 75% token 缩减,以及转述帖提到的 3.5 倍提速,能在更多任务中成立,这类 codec-native 路线可能会成为实时视频助手、监控理解、事件解说等应用的重要基础设施。
2026-07-27 ~ 2026-07-29 · 5 条相关
一手来源
- 微软 Mage-VL 在流式多模态任务中减少 75% 视觉 token — microsoft ·
- 微软在 Hugging Face 发布 Mage-VL 4B,主打流式视频理解 — multimodalart · 2026-07-27
- 微软在 Hugging Face 发布 Mage-VL,主打流式图像和视频理解 — _akhaliq · 2026-07-28
- 微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍 — pmttyji · 2026-07-29
- 微软发布 4B 流式视觉模型 Mage-VL,主打实时视频理解 — anselm · 2026-07-29
- 【源头】微软 Mage-VL 在流式多模态任务中减少 75% 视觉 token — microsoft · 2026-07-29