LOCI 混合空间记忆架构:流式视频世界模型复现重访场景
IFM · hf · 2026-10-02
IFM 在 Hugging Face 发布 LOCI,一种面向流式世界模型的混合空间记忆架构,解决「相机重访已见区域时能否还原此前内容」的记忆-检索问题。
核心思路
- KV cache 保留视觉细节但随视频长度增长;循环记忆紧凑但把历史压进固定状态,过去的观察不可直接访问。LOCI 同时保留两种表示:一半 transformer 块用主注意力维护过去观察的 KV cache,另一半限制在当前 chunk 内,由以投影相机几何为条件的循环线性注意力记忆补充读写,使视角同时参与记忆寻址与存储内容。
效果
- 在公开 MIND 记忆基准及留出录制轨迹上,重访内容还原度优于代表性世界模型与同配方全 softmax 模型。
- 全历史模式下,同等长度峰值显存较全 softmax 降低约 30%。
- 在有限保留观察库下,可恒定显存流式处理长视频,同预算下保真度仍高于全 softmax。
「研究」频道最新
- 向量搜索拆成四步:从编码到点积排序的完整原理 — techNmak · 2026-10-02
- 计算正确≠科学发现:Anthropic 文章反思 AI 科研助手边界 — Crescitaly · 2026-10-02
- 转推 Chollet:transduction 记答案,induction 学程序,推理模型押注后者 — sebpaquet · 2026-10-02
- NVIDIA 论文:任务越长模型越马虎,128K 长任务准确率平均降 62.8% — rohanpaul_ai · 2026-10-02
- HGR 框架用高阶文法序列化分子拓扑,生成Validity 100% — CatAstro_Piyush · 2026-10-02
- Meta 研究提出 Sharpening Tax:后训练提升首试精度却收窄解空间 — iScienceLuvr · 2026-10-02