微软 Mage-VL 在流式多模态任务中减少 75% 视觉 token
microsoft · hf · 2026-07-29
微软提出了 Mage-VL,一个面向实时理解与交互的 codec-native streaming multimodal foundation model。它的核心是自定义 tokenizer Mage-ViT,不再均匀采样所有帧,而是优先编码动态、信息密度高的区域。
- 效率:视觉 token 消耗减少 75%+,同时保留时空上下文。
- 训练规模:约 5.6 亿张无标注图片和 1 亿段无标注视频帧。
- 架构:轻量的 System 1 事件门控 + 因果 System 2 解码器。
- 效果:Mage-VL-4B 在静态任务上可对标 Qwen3-VL-4B,在视频理解和 2D/3D 空间推理上更强,推理墙钟时间最高快 3.5 倍。
- 补充:论文还总结了 7 条关于数据效率和多模态训练管线的经验发现。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「多模态」频道最新
- 商汤信息图模型 Infographic-V3 上线,支持局部编辑与全局风格转换 — Secret_Yak2496 · 2026-07-30
- 实用技巧:用简笔画示意图精准控制AI视频生成视角 — round · 2026-07-30
- 实时可控视频世界模型 Wonder:16FPS生成长视频 — qixing_huang · 2026-07-30
- 长视频 Outpainting 遇瓶颈:拼接与色彩一致性难解 — Alex-edits123 · 2026-07-30
- 开源工具Contour:用Gemini将2D地形图转为可语音导览的3D空间 — tom_doerr · 2026-07-30
- 告别手动改词:开发者用 AI 写出 ComfyUI 触发词自动替换节点 — TrueRedditMartyr · 2026-07-30