微软发布 4B 流式视觉模型 Mage-VL,主打实时视频理解
anselm · x · 2026-07-29
微软发布了 Mage-VL,一款面向实时视频理解的 4B 流式视觉语言模型。
- 官方把它称为 codec-native streaming VLM,主打边看边说出正在发生什么。
- 用户还能用自然语言指定关心的时刻,比如“火车到站的时候”或“进球瞬间”。
- 它的卖点是效率:相比离线分析或高算力堆叠,这个模型强调对流式输入的持续处理能力。
所属事件:微软发布 4B 流式多模态模型 Mage-VL(5 条相关)→
「多模态」频道最新
- 实用技巧:用简笔画示意图精准控制AI视频生成视角 — round · 2026-07-30
- 实时可控视频世界模型 Wonder:16FPS生成长视频 — qixing_huang · 2026-07-30
- 长视频 Outpainting 遇瓶颈:拼接与色彩一致性难解 — Alex-edits123 · 2026-07-30
- 开源工具Contour:用Gemini将2D地形图转为可语音导览的3D空间 — tom_doerr · 2026-07-30
- 告别手动改词:开发者用 AI 写出 ComfyUI 触发词自动替换节点 — TrueRedditMartyr · 2026-07-30
- Flux 3与Minimax H3相继发布,AI视频模型竞赛白热化 — matchaman11 · 2026-07-30