微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍
pmttyji · reddit · 2026-07-29
微软发布 Mage-VL,一款 4B 参数的 codec-native(编码原生)流式多模态基础模型,专为高效的图像与视频理解设计。
- 核心创新:视觉编码器完全从零训练,借鉴视频编解码器的 I/P 帧机制(保留锚点帧,仅提取动态区域的预测帧 patch),将视觉 token 数量大幅削减 超 75%。
- 推理加速:在保持准确率持平的前提下,相比传统的均匀帧采样实现了最高 3.5 倍的推理加速,且支持原生分辨率扩展。
- 双系统架构:采用 System 1(轻量级认知门控,负责低延迟监控)与 System 2(完整 VLM,处理复杂事件)的协同设计,在单一模型内实现主动流式响应。
- 性能表现:在固定 Qwen3-4B 作为语言基座的情况下,视频理解与空间智能相关基准测试成绩大幅超越同规模的 Qwen3-VL-4B。
所属事件:微软发布Mage-VL编码原生流式多模态模型(3 条相关)→
「模型」频道最新
- Claude Code 隐藏技巧:手动指定调用旧版 Opus 模型 — voooooogel · 2026-07-29
- Claude Sonnet 3 将在 7 月 30 日退场 — repligate · 2026-07-29
- Perplexity 向 Pro 和 Max 用户开放 Kimi K3 — perplexity_ai · 2026-07-29
- Claude Opus 5 在 DeepSWE 上拿到 74%,登顶长程编码评测 — brandon_galang · 2026-07-29
- Nvidia 的 LatentMoE 论文刚发 6 个月就被用于预训练改造 — peterjliu · 2026-07-29
- 内部评测图比较各模型居中一个 div 要多少 token — BLUECOW009 · 2026-07-29