TwelveLabs 做出视频记忆层,能存时刻、实体和主题
AI Engineer · youtube · 2026-07-23
在这场题为 “Video Has No Memory. Here's How We Built One.” 的演讲里,TwelveLabs 的 James Le 提出:大多数视频 AI 之所以每次回答都像“重新看一遍”,不是因为上下文窗口太小,而是因为视频本身缺少可长期复用的记忆结构。
他的核心观点是,不要把视频当成一堆帧,而要把它看成一个时空体(spatial-temporal volume),再在其上构建记忆层:
- 一次摄取,多次推理
- 存的是原始“原语”,而不是最终答案
- 每个结论都要能回到时间戳
- 记忆内容由任务意图决定,不同场景记不同东西
TwelveLabs 的方案包括 embedding encoder、context store 和对外 API 的 video language model。演讲里还给出了多个 demo:世界杯视频检索、跨全库追踪 Messi、交通安防识别,以及广告位投放场景。
「多模态」频道最新
- 已有视频做口型同步仍频频翻车,5 段素材全失败 — Kyrannio · 2026-07-23
- Reddit 用户晒出 RTX 4070 Super 图生视频工作流 — Professional_Wash169 · 2026-07-23
- NoSpoon 音乐视频自动化卡在模型听不懂音乐 — Kyrannio · 2026-07-23
- Krea 2 早期训练结果已能产出可展示的视觉样本 — darlens13 · 2026-07-23
- ChatGPT Image 2.0 生成一幅古典氛围感油画 — DeryaTR_ · 2026-07-23
- ChatGPT Work 在通勤途中把 Slack 数百张照片做成蒙太奇 — gabrielchua · 2026-07-23