微软在 Hugging Face 发布 Mage-VL,主打流式图像和视频理解
_akhaliq · x · 2026-07-28
微软在 Hugging Face 上发布了 Mage-VL,定位为一个 codec-native、支持主动流式处理的多模态基础模型,主要用于 图像和视频理解。
配图展示的是一个“事件触发式解说”结构:先由 gate predictor 判断是否需要发声,只有在门控打开时才由 LLM decoder 生成文字/语音评论;视觉侧由 Mage-ViT 提供共享特征,并对连续直播画面流做选择性解说。
整体看,这不是普通的离线视频字幕模型,而是面向流式多模态理解与实时输出的方案。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「Infra」频道最新
- 驳斥「DeepSeek与国产光刻机」恐慌论:被夸大的成本与差距 — teortaxesTex · 2026-07-30
- 纯CPU跑通 Kimi K3:自研 Q3 量化占用 1.1TB,速度达 4.2 t/s — Fun-Meaning-6474 · 2026-07-30
- GPT-6将实现自我迭代优化推理算力 — imjustnewatai · 2026-07-30
- vLLM 联合 Baseten 上线 Kimi K3 生产级 API — vllm_project · 2026-07-30
- 预算 600 英镑:本地跑稠密模型买 GPU,还是靠内存跑 MoE? — Agitated_Camel1886 · 2026-07-30
- 微软与亚马逊今年各砸两千亿美元建 AI 数据中心,投资者开始追问回报 — luisdans · 2026-07-30