hRoPE 研究发现:注意力压缩深度才是段落层级结构的真实信号
Shuyang Xiang · hf · 2026-09-28
标准位置编码只用一维阅读顺序表示位置,无法刻画文本的层级结构。该研究提出分层 RoPE(hRoPE),把段落、句子、token 索引作为独立通道编码。
核心实验设计:固定 token 序列,仅干预段落坐标 p1,用精确的 token 距离估计器测量跨段落注意力。结果显示注意力相对基线被压缩,但作者指出压缩本身不足以证明真实结构——用密度匹配的随机标签替换段落坐标后,架构完全相同的通道同样出现压缩,只是更浅。
真正的区分信号是压缩深度:真实结构的压缩更深,且随语料库变化,而对照组没有这种模式。作者比较了八种仅凭语料可计算的量(词法持续性、段落长度、embedding 相干性等)和三种结构构造,没有一种能完全复现深度指标给出的跨语料排序,embedding 相干性最接近。结论:在其实验设定下,可复现的层级结构信号是压缩深度而非压缩位置。
「研究」频道最新
- 用范畴论给深度学习画图:PyNCD 把 FlashAttention 画在餐巾上 — GioeleZardini · 2026-09-28
- 交互式实验室手动选下一个词,直观演示采样与温度机制 — CurieuxExplorer · 2026-09-28
- 交互式 Attention 图解页大更新:从缩放点积到 DeepSeek 潜注意力 — vtabbott_ · 2026-09-28
- EMNLP 2026 论文被曝直接使用 GPT 生成插图,评审标准遭质疑 — ATHii-127 · 2026-09-28
- 移除 10% 关键细胞致输出骤降三倍,可验证的可解释性新方法 — bravo_abad · 2026-09-28
- IndicBankBench:799 例基准测银行 AI 助手,最高可靠率仅 58.2% — NPCI · 2026-09-28