Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention
Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Jaisidh Singh, Arber Zela, Timur Carstensen, Jenia Jitsev, Frank Hutter, Volkan Cevher, Antonio Orvieto, Aaron Klein
cs.LG
2026-09-21
把Kimi Delta Attention的通道门扩到[-1,1]、β扩到[0,2],一次更新就能拼出平面旋转。单层可跟踪SO(3)子群;1.3B下游平均准确率54.06%,与KDA持平,吞吐保留96%–97%。
线性RNN用delta-rule做状态更新,复杂度随序列长度线性增长,状态大小固定。更新形态是「对角门控再加一次秩一修正」:Kimi Delta Attention(KDA)写成(I − βkk⊤)Diag(α)。这条结构快,但表达力被卡在实谱和低秩混合上。
要做平面旋转,先前的DeltaProduct₂把两次delta-rule叠进同一步,秩和算力都上去了。KDA的通道门本来是按通道各给一个衰减,看起来只是Gated DeltaNet的标量门换成了对角。这篇的判断是:只要把门从[0,1]扩到[-1,1],再把β扩到[0,2],通道门自己就能提供一次坐标反射,和Householder反射拼出旋转,不必再加一次秩一更新。
扩参后的模型叫Complex KDA(CKDA)。实现上β=2σ(b),门控r=2σ(a)−1,改动是KDA循环核上的小补丁。
几何上,β=2时Householder是一次反射;对角门若有一条坐标取−1,就是另一次沿坐标轴的反射。两次反射的镜面夹角为θ,合成就是转2θ。标量门做不到这件事:Gated DeltaNet的门和Householder永远对易,谱一直是实的,把门扩到负数也只贡献全局符号。
理论侧给了几条硬结果:
乘积上,n维非扩张矩阵最多用2n−2个CKDA因子覆盖,正交矩阵n−1个就够。
状态跟踪:一层模型在S₃、S₄字问题上,两种扩参一起开才有最强长度外推;只扩门或只扩β,长序列S₃缩放准确率掉到约0.2,相当于只会辨A₃的两个陪集。学成的头会把β推近2、门接近±1,谱上出现靠近单位圆的复共轭对,和理论构造对得上。A₅随机初始化学不会,要靠四元数构造附近初始化才外推。
周期音频续写:半小节提示后输入置零,单次前向续写。训练最长136,测到264时CKDA信噪比38.1 dB,因果Transformer掉到2.8 dB。GRU在这个任务上仍然更准。
语言模型:340M、15B Nemotron-CC token上,CKDA下游平均准确率52.30%,标准KDA是51.32%。1.3B、100B FineWeb-Edu token上,循环CKDA平均准确率54.06%,他们自己的bounded-gate KDA是54.09%,Gated DeltaNet-2是53.11%,SWA-hybrid Transformer是50.86%。Wiki困惑度CKDA 15.78,KDA 15.73。3:1混合注意力变体CKDA平均54.37,KDA 53.92。吞吐是标准KDA的96%–97%。
给KDA系模型加平面旋转,不必换成DeltaProduct₂那种每步两次秩一更新。改动是参数范围和符号处理,核吞吐几乎不动。做状态跟踪、周期信号、需要非交换组合的任务,这是一条比叠两次Householder更便宜的路。语言建模上它没有把KDA拉开,更接近「表达力补齐后不掉点」。
代码在OpenEuroLLM/ComplexKDA,权重也已公开。
秩一DPLR结构本身限制了每步只能有一对持续复特征值,多平面旋转仍要靠时间上连乘。A₅可表示但标准训练学不会,表达力不等于可学性。加权自动机那条要β>2,丢掉非扩张保证。1.3B上CKDA和KDA下游几乎打平,Wiki困惑度还略差;340M的约1个点优势也依赖spread初始化。音频任务GRU仍更好。和公开KDA数字的对比还受sigmoid门实现、混合注意力配比不同影响。