微软 Mage-VL 在流式多模态任务中减少 75% 视觉 token

microsoft · hf · 2026-07-29

微软提出了 Mage-VL,一个面向实时理解与交互的 codec-native streaming multimodal foundation model。它的核心是自定义 tokenizer Mage-ViT,不再均匀采样所有帧,而是优先编码动态、信息密度高的区域。

所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →