SpectralShift 用谱重参数化扩展 Gated DeltaNet 上下文窗口
RUC-AIBOX · hf · 2026-09-17
线性注意力层正被大规模用于长上下文建模以替代 softmax 注意力,但现有上下文扩展方法通常直接继续预训练而不修改这些层,忽略了线性注意力状态动态的谱特性。人民大学团队从转移矩阵的谱视角研究 Gated DeltaNet(GDN)的长上下文扩展,识别出两个关键因素:(1) 与目标依赖长度对齐的足够宽的慢谱带;(2) 保留快衰减模式以实现状态清除与上下文切换。
据此提出 SpectralShift:通过重参数化 alpha 投影的初始化来重塑衰减谱、增强慢传播能力,并引入 alpha 投影的学习率缩放以利于长上下文训练。实验显示 SpectralShift 在训练中持续提升长上下文能力,是扩展线性注意力模型上下文窗口的有效方案。代码已在 GitHub 开源。
「研究」频道最新
- 一个实验判断生成模型是泛化还是死记:换数据集比输出 — prof_kamilov · 2026-09-17
- PhenoBench 发布:90 项任务检验 LLM 临床表型预测能力 — segal_eran · 2026-09-17
- François Fleuret:AI 解数学像数值积分,只给答案不给洞见 — francoisfleuret · 2026-09-17
- UIUC 设立协调式智能体生物学中心,用多智能体 AI 研究大脑衰老 — dotey · 2026-09-17
- ActionPiece 重构 VLA 动作分词,LIBERO 达 94.8% — DeepCybo · 2026-09-17
- 伯克利提出 ComPO:零阶偏好对齐新范式缓解似然偏移 — Berkeley · 2026-09-17