Twelve Labs 发布面向视频检索、记忆和智能体的技术栈

qdrant_engine · x · 2026-07-29

Twelve Labs 认为,视频不能简单当成“逐帧图片”或“带时间戳的转录文本”,因为运动、因果和时间推进本身就是信息。James Le 在 Vector Space Day SF 上指出,视频系统常见三类失败:上下文错误、记忆错误、推理错误;并介绍了对应的技术栈:Marengo 负责视频检索,Pegasus 负责把检索到的片段转成结构化答案,Jockey 作为面向视频语料工作流的 agentic framework 和记忆层,底层由 Qdrant 提供存储与检索。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →