MOSS-VL:支持实时交互的开源视觉语言模型
OpenMOSS-Team · hf · 2026-08-18
OpenMOSS 团队发布了 MOSS-VL 技术报告。这是一个开源的视觉语言模型家族,通过在生成过程中使用门控交叉注意力机制来关注视觉信息,从而实现实时交互。该模型利用合成交互语料库和分阶段课程学习,在减少首字生成延迟的同时实现了强大的流式性能。
「多模态」频道最新
- 高精昆虫 Gaussian Splatting 3D 重建展示 — janusch_patas · 2026-08-18
- 西湖大学等提出三体散射算法,单步生成图像达 SOTA — jiqizhixin · 2026-08-18
- 寻找逼真产品测评 AI 数字人工具 — Mysterious_Level852 · 2026-08-18
- 实战:用 Midjourney 与 GPT IMG 2 生成角色场景 — aziz4ai · 2026-08-18
- Karate Warrior:Midjourney 与 GPT 图像生成视频 — aziz4ai · 2026-08-18
- 完整 Prompt 分享:玻璃与铜丝之手下的裁缝日常 — tisch_eins · 2026-08-18