Mk1.5 发布:扩展视频定位、音频与视听理解能力
AkshatS07 · x · 2026-09-25
团队发布 Mk1.5,继续扩展感知理解的模态与保真度:新增视频定位(video localization),并扩展到音频与视听理解。
针对实时构建现实世界 Agent 时模型容量难以容纳世界知识的痛点,Mk1.5 学会对工具与外部知识进行推理,将世界知识与推理清晰解耦:可调用搜索、以图搜图等工具,在保持高效的同时回答复杂的世界知识问题。
所属事件:Mk1.5 实时多模态推理模型发布,延迟降低 2-5 倍(4 条相关)→
「多模态」频道最新
- 零基础一条 prompt:Opus 5.5 生成动画视频并从零合成配乐 — prasenx · 2026-09-26
- Vector 研究员 Kelsey Allen 用 3DSPA 让生成视频更像物理世界 — VectorInst · 2026-09-26
- Suno v6 实测:舞者先编舞后配乐,用动作反向生成歌曲 — suno · 2026-09-26
- PixVerse 发布 R2 世界模型:自存错误状态训练,长程漂移降 35.8% — LearnWithBishal · 2026-09-26
- PixVerse R2 实时可交互视频:WASD 控制的持续世界模型 — LearnWithBishal · 2026-09-26
- 让 Opus 5.5 作小提琴配乐加动画,博主被模型的品味惊到 — Hesamation · 2026-09-26