HoPE 提出不随时间衰减的位置编码,增强长上下文能力

burny_tech · x · 2026-07-25

HoPE 提出一种不依赖长期衰减的位置编码

这篇论文提出了 HoPE,目标是提升大模型的上下文感知与外推能力。

作者认为,许多传统位置编码默认“远处 token 相关性更低”,但这个假设在 LLM 时代已经不够准确。论文的实证分析显示,模型往往学习到的是一种局部衰减、整体 U 型的注意力模式;作者进一步把这种现象与 RoPE(旋转位置编码)里的某些成分联系起来。

HoPE 的做法是:用位置无关的方式替换 RoPE 中具体依赖位置信息的部分,只保留高频信号。论文声称它带来两类收益:

配图是论文首页与摘要页,显示该方法针对上下文感知和外推做了系统实验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →