微软在 Hugging Face 发布 Mage-VL,主打流式图像和视频理解
_akhaliq · x · 2026-07-28
微软在 Hugging Face 上发布了 Mage-VL,定位为一个 codec-native、支持主动流式处理的多模态基础模型,主要用于 图像和视频理解。
配图展示的是一个“事件触发式解说”结构:先由 gate predictor 判断是否需要发声,只有在门控打开时才由 LLM decoder 生成文字/语音评论;视觉侧由 Mage-ViT 提供共享特征,并对连续直播画面流做选择性解说。
整体看,这不是普通的离线视频字幕模型,而是面向流式多模态理解与实时输出的方案。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23