微软 Mage-VL 在流式多模态任务中减少 75% 视觉 token
microsoft · hf · 2026-07-29
微软提出了 Mage-VL,一个面向实时理解与交互的 codec-native streaming multimodal foundation model。它的核心是自定义 tokenizer Mage-ViT,不再均匀采样所有帧,而是优先编码动态、信息密度高的区域。
- 效率:视觉 token 消耗减少 75%+,同时保留时空上下文。
- 训练规模:约 5.6 亿张无标注图片和 1 亿段无标注视频帧。
- 架构:轻量的 System 1 事件门控 + 因果 System 2 解码器。
- 效果:Mage-VL-4B 在静态任务上可对标 Qwen3-VL-4B,在视频理解和 2D/3D 空间推理上更强,推理墙钟时间最高快 3.5 倍。
- 补充:论文还总结了 7 条关于数据效率和多模态训练管线的经验发现。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「多模态」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- Krea2 用户吐槽:想让 AI 生成「真实长相」的女性,难于登天 — Jaded_Caterpillar873 · 2026-09-23
- 仅凭歌词加音频,Opus 5.5 复刻出视觉作品引开发者惊叹 — repligate · 2026-09-23
- MiniMax H3 只用 8 步出图,真实感引来「这是真的吗」追问 — Cequejedisestvrai · 2026-09-23
- Qwen Image 2.1 值得换吗?实测者抱怨编辑强但画质「塑料感」 — knhabs · 2026-09-23
- 职业画师自训画风 LoRA 失败:66 张图训出的模型要么没变化要么幻觉更多 — Shady-Dragon · 2026-09-23