Mk1.5 发布:扩展视频定位、音频与视听理解能力

AkshatS07 · x · 2026-09-25

团队发布 Mk1.5,继续扩展感知理解的模态与保真度:新增视频定位(video localization),并扩展到音频与视听理解。

针对实时构建现实世界 Agent 时模型容量难以容纳世界知识的痛点,Mk1.5 学会对工具与外部知识进行推理,将世界知识与推理清晰解耦:可调用搜索、以图搜图等工具,在保持高效的同时回答复杂的世界知识问题。

所属事件:Mk1.5 实时多模态推理模型发布,延迟降低 2-5 倍(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →