HoPE 提出不随时间衰减的位置编码,增强长上下文能力
burny_tech · x · 2026-07-25
HoPE 提出一种不依赖长期衰减的位置编码
这篇论文提出了 HoPE,目标是提升大模型的上下文感知与外推能力。
作者认为,许多传统位置编码默认“远处 token 相关性更低”,但这个假设在 LLM 时代已经不够准确。论文的实证分析显示,模型往往学习到的是一种局部衰减、整体 U 型的注意力模式;作者进一步把这种现象与 RoPE(旋转位置编码)里的某些成分联系起来。
HoPE 的做法是:用位置无关的方式替换 RoPE 中具体依赖位置信息的部分,只保留高频信号。论文声称它带来两类收益:
- 更好的自发注意力优化与长上下文外推
- 对位置与语义成分的分离优化,从而提升整体表现
配图是论文首页与摘要页,显示该方法针对上下文感知和外推做了系统实验。
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11