Mk1.5 实时多模态推理模型发布,延迟降低 2-5 倍
面向物理世界实时场景的多模态推理模型 Mk1.5 发布,官方称性能持平或超越上代 Mk1 的同时延迟改善 2-5 倍,解锁更多实时应用。新版本新增视频定位(video localization)能力,并将理解范围扩展到纯音频与视听。团队还阐述了两条核心原则:以更强推理换取小模型能力(「多想一会儿」),以及将世界知识外置,通过工具调用与子智能体并行研究实现。
2026-09-25 ~ 2026-09-25 · 4 条相关
- Mk1.5 实时推理模型发布:延迟降低 2-5 倍 — AkshatS07 · 2026-09-25
- Mk1.5 发布:扩展视频定位、音频与视听理解能力 — AkshatS07 · 2026-09-25
- Mk1.5 详解:知识外置工具调用+子智能体并行研究 — AkshatS07 · 2026-09-25
- Mk1.5 发布:视频定位能力升级,扩展至音频与视听理解 — AkshatS07 · 2026-09-25