TwelveLabs 做出视频记忆层,能存时刻、实体和主题

AI Engineer · youtube · 2026-07-23

在这场题为 “Video Has No Memory. Here's How We Built One.” 的演讲里,TwelveLabs 的 James Le 提出:大多数视频 AI 之所以每次回答都像“重新看一遍”,不是因为上下文窗口太小,而是因为视频本身缺少可长期复用的记忆结构。

他的核心观点是,不要把视频当成一堆帧,而要把它看成一个时空体(spatial-temporal volume),再在其上构建记忆层:

TwelveLabs 的方案包括 embedding encoder、context store 和对外 API 的 video language model。演讲里还给出了多个 demo:世界杯视频检索、跨全库追踪 Messi、交通安防识别,以及广告位投放场景。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →