微软发布 4B 流式多模态模型 Mage-VL

微软发布了 Mage-VL,一款 4B 参数的 codec-native 流式多模态基础模型,面向实时图像与视频理解及交互。微软称其核心 tokenizer“Mage-ViT”可在流式多模态任务中减少 75% 视觉 token;转述帖还将其概括为可带来 3.5 倍推理提速。结合多条帖子来看,这个模型主打“边看边理解”,并支持用自然语言指定要重点关注的时刻或事件。

已确认

为什么重要

2026-07-27 ~ 2026-07-29 · 5 条相关

一手来源