微软发布 4B 流式视觉模型 Mage-VL,主打实时视频理解
anselm · x · 2026-07-29
微软发布了 Mage-VL,一款面向实时视频理解的 4B 流式视觉语言模型。
- 官方把它称为 codec-native streaming VLM,主打边看边说出正在发生什么。
- 用户还能用自然语言指定关心的时刻,比如“火车到站的时候”或“进球瞬间”。
- 它的卖点是效率:相比离线分析或高算力堆叠,这个模型强调对流式输入的持续处理能力。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「多模态」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- Krea2 用户吐槽:想让 AI 生成「真实长相」的女性,难于登天 — Jaded_Caterpillar873 · 2026-09-23
- 仅凭歌词加音频,Opus 5.5 复刻出视觉作品引开发者惊叹 — repligate · 2026-09-23
- MiniMax H3 只用 8 步出图,真实感引来「这是真的吗」追问 — Cequejedisestvrai · 2026-09-23
- Qwen Image 2.1 值得换吗?实测者抱怨编辑强但画质「塑料感」 — knhabs · 2026-09-23
- 职业画师自训画风 LoRA 失败:66 张图训出的模型要么没变化要么幻觉更多 — Shady-Dragon · 2026-09-23