Mk1.5 发布:视频定位能力升级,扩展至音频与视听理解
AkshatS07 · x · 2026-09-25
新版本 Mk1.5 发布,继续扩展感知理解的模态与精度:新增视频定位(video localization)能力,并将理解范围扩展到纯音频与视听(audio-visual)理解。官方还展示了更多能力,包括改进的第一人称(egocentric)理解、推理能力,以及跨具身(cross-embodiment)应用示例。提供了在线 demo 和博客供试用。
所属事件:Mk1.5 实时多模态推理模型发布,延迟降低 2-5 倍(4 条相关)→
「多模态」频道最新
- 一句话提示词直出宣传视频:关键在「每帧固定算出、结果完全一致」 — ezshine · 2026-09-26
- 视频模型输出被指像成人内容,作者:训练数据是动作片和舞蹈 — pixlpa · 2026-09-26
- 网友用 Claude Opus 5.5 作钢琴曲,配 JavaScript 手绘动画 — angrypenguinPNG · 2026-09-26
- 用 Minimax H3 重制《EVA》:假如故事真发生在 2015 年 — Certain_Potato_4509 · 2026-09-26
- 网友实测 Opus 5.5 做动态视频:自编电子乐还卡点,中秋主题惊艳 — op7418 · 2026-09-26
- Opus 5.5 一把生成整条 SaaS 宣传视频,成本仅 7 美元 — nidhanshusharma · 2026-09-26