Periscope 无需训练读超长文,9k 窗口等效 1M 上下文
_reachsumit · x · 2026-10-06
arXiv 论文《Periscope: Extending Frozen Language Models Beyond Their Context Window》提出一种免训练推理方法,让冻结的 LLM 读取超出上下文窗口的长文本。
核心做法
- 将 N 个文本块排成 K×K 网格(K=⌈√N⌉),向冻结模型提出同一问题,分别针对 K 个连续局部跨度和 K 个跨全文的步进跨度,通过读取单个 token 上的 log-odds 获取答案倾向。
- 每个答案取局部与步进分数的最优值;对所有块打分即可免费得到证据图(evidence map),峰值即支持答案的文本块。
- 每次探测仅需约 √(s·c) 个 token,因此 W 窗口可达 W²/c 长度,成本约 s^1.5。
结果
- LongBench v2 上,只读证据图排名最高的 K 块(约 9k token)即匹配同一模型从 32k 到 1M 窗口的最佳读取结果。
- InfiniteBench(中位上下文 150k)上比最佳窗口读取高 5 分。
- 在 BRIGHT 长文档语料检索中,NDCG@10 为六种方法中最佳。
所属事件:KAUST 推出免训练方法 Periscope,让冻结模型读超长文(2 条相关)→
「研究」频道最新
- 骨骼肌肉形态空间漫游:会变形的骨架研究演示 — zzznah · 2026-10-06
- 表格基础模型怎么推理?nanoTabPFN 架构拆解笔记 — pandeyparul · 2026-10-06
- WaveFront 解码让循环语言模型提速最高 4.81 倍,无需训练 — pmttyji · 2026-10-06
- HLA-WM:免训练混合注意力,长视频世界模型记忆省12倍 — Monash · 2026-10-06
- LiFT 循环Transformer:参数省60%,FID 反降3.34点 — VISLab-Amsterdam · 2026-10-06
- GeoSET:首个SAR转光学通用基础模型,300万对训练数据 — Jeonghyeok Do · 2026-10-06