Mk1.5 发布:视频定位能力升级,扩展至音频与视听理解

AkshatS07 · x · 2026-09-25

新版本 Mk1.5 发布,继续扩展感知理解的模态与精度:新增视频定位(video localization)能力,并将理解范围扩展到纯音频与视听(audio-visual)理解。官方还展示了更多能力,包括改进的第一人称(egocentric)理解、推理能力,以及跨具身(cross-embodiment)应用示例。提供了在线 demo 和博客供试用。

所属事件:Mk1.5 实时多模态推理模型发布,延迟降低 2-5 倍(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →