HoPE 提出不随时间衰减的位置编码,增强长上下文能力
burny_tech · x · 2026-07-25
HoPE 提出一种不依赖长期衰减的位置编码
这篇论文提出了 HoPE,目标是提升大模型的上下文感知与外推能力。
作者认为,许多传统位置编码默认“远处 token 相关性更低”,但这个假设在 LLM 时代已经不够准确。论文的实证分析显示,模型往往学习到的是一种局部衰减、整体 U 型的注意力模式;作者进一步把这种现象与 RoPE(旋转位置编码)里的某些成分联系起来。
HoPE 的做法是:用位置无关的方式替换 RoPE 中具体依赖位置信息的部分,只保留高频信号。论文声称它带来两类收益:
- 更好的自发注意力优化与长上下文外推
- 对位置与语义成分的分离优化,从而提升整体表现
配图是论文首页与摘要页,显示该方法针对上下文感知和外推做了系统实验。
「研究」频道最新
- RL 持续提升 Agent 想象力模型,Photon-1 性能反超 Gemini — ycombinator · 2026-07-25
- 有人想从一张照片生成不变姿势的侧面和背面图用于 3D 建模 — LoudPoem9492 · 2026-07-25
- 陶哲轩幻灯片称 AI 时代论文更要重视阐述而非只拼证明 — AlexKontorovich · 2026-07-25
- Lean 形式化验证 Gowers 团队的锐利 product-free 定理 — satnam6502 · 2026-07-25
- 审计发现前沿模型文档谈多视角,却没人明确写 pluralism — evijit · 2026-07-25
- ICML 可解释性讲座追问机制可解释性究竟为了什么 — ericjmichaud_ · 2026-07-25