Google 发布 KeyRec:仅用 10% 视觉 token 预算搞定长视频与流式理解
google · hf · 2026-10-06
Google 提出 KeyRec,一个免训练的视觉记忆框架,解决 VLM 处理长视频与连续流时视觉 token 随时长累积、推理成本爆炸的问题。
设计
- 写入阶段(与查询无关):视觉缓存保留细粒度近期观察,历史证据组织进结构化「事件库」,按相对新颖度提出候选事件,在线执行 add-merge-evict 更新。
- 读取阶段:收到问题时,纯文本路由器在近期记忆与事件记忆之间自适应分配固定 readout 预算,无需重处理历史帧。
- 直接作用于模型侧视觉嵌入,同时支持模块化 encoder-projector VLM 和无 encoder/projector 的 NEO-ov 架构。
效果
- 4 个流式/长视频 benchmark × 3 个 VLM 骨干:15 个设置中 13 个取得最佳压缩性能,仅用 10% 的密集视觉 token 预算。
- 实时问题上超最强压缩基线 2.21-18.37 分;6 个长视频设置中 5 个最佳;NEO-ov 2B 全部设置最佳。
「多模态」频道最新
- 万能产品广告图提示词走红:JSON 模板适配任意商品与品牌色 — aziz4ai · 2026-10-06
- Suno 爆红创作者 Dream Relic 发布新专辑《Lost In a Dream》 — suno · 2026-10-06
- HyperFrames 桌面应用「Vibe Editing」首试:一句话 prompt 出片效果意外能打 — toolstelegraph · 2026-10-06
- AssemblyAI 推 Universal 3.6 Pro:语音 agent 转写错误减 45% — AssemblyAI · 2026-10-06
- 三年前威尔·史密斯吃面如外星人,如今他在3D里大战意面 — Calm_Cartographer324 · 2026-10-06
- 开源发布 fibo-scene-analyzer:单模型输出结构化描述与姿态检测框 — linoy_tsaban · 2026-10-06