微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍
pmttyji · reddit · 2026-07-29
微软发布 Mage-VL,一款 4B 参数的 codec-native(编码原生)流式多模态基础模型,专为高效的图像与视频理解设计。
- 核心创新:视觉编码器完全从零训练,借鉴视频编解码器的 I/P 帧机制(保留锚点帧,仅提取动态区域的预测帧 patch),将视觉 token 数量大幅削减 超 75%。
- 推理加速:在保持准确率持平的前提下,相比传统的均匀帧采样实现了最高 3.5 倍的推理加速,且支持原生分辨率扩展。
- 双系统架构:采用 System 1(轻量级认知门控,负责低延迟监控)与 System 2(完整 VLM,处理复杂事件)的协同设计,在单一模型内实现主动流式响应。
- 性能表现:在固定 Qwen3-4B 作为语言基座的情况下,视频理解与空间智能相关基准测试成绩大幅超越同规模的 Qwen3-VL-4B。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「模型」频道最新
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23
- Claude 修复后回归,实测者称速度明显变快 — evielync · 2026-09-23
- 仅凭歌词加音频,Opus 5.5 复刻出视觉作品引开发者惊叹 — repligate · 2026-09-23