TwelveLabs 做出视频记忆层,能存时刻、实体和主题
AI Engineer · youtube · 2026-07-23
在这场题为 “Video Has No Memory. Here's How We Built One.” 的演讲里,TwelveLabs 的 James Le 提出:大多数视频 AI 之所以每次回答都像“重新看一遍”,不是因为上下文窗口太小,而是因为视频本身缺少可长期复用的记忆结构。
他的核心观点是,不要把视频当成一堆帧,而要把它看成一个时空体(spatial-temporal volume),再在其上构建记忆层:
- 一次摄取,多次推理
- 存的是原始“原语”,而不是最终答案
- 每个结论都要能回到时间戳
- 记忆内容由任务意图决定,不同场景记不同东西
TwelveLabs 的方案包括 embedding encoder、context store 和对外 API 的 video language model。演讲里还给出了多个 demo:世界杯视频检索、跨全库追踪 Messi、交通安防识别,以及广告位投放场景。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11