MOSS-VL-Realtime 开源
victormustar · x · 2026-07-14
MosiAI 开源了 **MOSS-VL-Realtime**,这是一个面向连续视频流实时视觉理解的 11B 视觉语言模型,采用 Apache-2.0 许可。 它支持在视频过程中随时提问,并且会“边看边答”:当画面变化时可修正或中断回答;在证据不足时也可以保持沉默。项目还提供 Base、Instruct 和 Realtime 三个版本,支持中英双语多模态理解,窗口长度达 256K token。
所属事件:MOSS-VL-Realtime开源实时视觉模型(2 条相关)→
「多模态」频道最新
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21
- Reddit 实测:Krea 2 Turbo 用绕过 LoRA 找回表情能力 — YentaMagenta · 2026-07-21
- Suno v5.5、Reason Studios 和 Grok Imagine 拼出 AI 音乐梗作 — Kyrannio · 2026-07-21
- AI 动漫创作被拆成可复用的提示词工作流 — Aiden_Tech_Ai · 2026-07-21