四个不起眼的架构选择叠加,长上下文性能最多掉 47%

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

COLM 2026

cs.CL

2026-08-11

预训练 26 个数据/优化器全固定、仅架构不同的 7B 模型,四个常见选择(QK-norm、GQA、滑窗注意力、4K 预训练)叠加让长上下文 HELMET 最多掉 47%,短上下文指标全预测不到。

这篇在解决什么

长上下文现在几乎是标配,但把一个预训练好的模型扩到 64K 以上是件很看运气的事。Llama 3 扩起来很顺,Olmo 就费劲。这个差距到底来自架构,还是来自 Llama 3 没公开的预训练数据,一直没定论。更实际的问题是:预训练阶段能不能早点看出一个模型将来好不好扩?这篇给的答案是——任何标准预训练指标都看不出来,而真正决定它的,是一组所有人都当作小事的架构选择。

方法

核心是一组高度受控的预训练实验,产物叫 OlmPool:26 个 7-8B 的模型。每个都先预训练 140B token(Chinchilla 最优数据量),再用 Longmino 数据混合做 10B token、64K 上下文的扩展,期间调整 RoPE theta。26 个模型的数据选择与顺序、优化器、学习率调度、分词器全部一致,只有四个轴在变,而且取值只来自 Llama 2/3、Qwen 3、Olmo 3 真正用过的:

选这四个,是因为它们既在近期主流模型之间真正有分歧,又都直接挂在注意力机制或上下文长度上。把其余一切固定,才能把架构从数据里剥出来。

一个容易被忽略的耦合:QK-norm 是为训练稳定性加的。作者实测,post-sublayer-norm 且不加 QK-norm 的组合在 140B token 之前就发散了。所以「移除 QK-norm」在实际里等于「移除 QK-norm 并换回 prenorm」。这是个真实的取舍,不是白捡的好处。

结果

26 个模型在 HELMET 32K 上的分数从 29.9 到 56.4,RULER 32K 从 44.7 到 67.7。同样的数据,仅凭架构就拉出了 26.5 分、约 47% 的差距。

叠加效应是全文的重心。每个特征单独看都很轻:4K 对 8K 预训练掉 1-2 分;单独加滑窗掉 1.1 分;GQA 随 KV head 数变化,比 Llama 3 的 8 个 KV head 多就更好、少就更差;QK-norm 是单个杠杆里最大的,从 Olmo 移除(配合 prenorm)涨 6 分,加到 Llama 3 上掉 3.8 分。但叠在一起就是超线性恶化:滑窗配 GQA 平均掉 9 分(单独滑窗才掉 1.1),最差的那个配置是 GQA + 滑窗 + headwise QK-norm 三件套。

最有用的预测器反而最糙:数一下一个模型占了几样这四个特征。这一个数字就拿到 R²=0.67(留一 0.61),比在四个轴上跑线性回归还准。四个全占未必比占三个更差,因为有些特征作用重叠——4K 滑窗在预训练期里看起来和直接 4K 预训练很像。

标准预训练指标对这件事几乎瞎:

指标与 32K HELMET 的 R²
预训练训练损失0.29
扩展阶段损失0.06
WikiText 困惑度(最佳内在指标)0.39
16 个短上下文 benchmark 均值0.17
扩展前 HELMET 8K0.32
四特征计数0.67(留一 0.61)

连最贴近的「扩展前 HELMET 8K」也只有 0.32,看不到两位数的跌幅来。Llama 3 的好扩是架构属性不是数据红利:它的架构在设计空间里名列前茅,而 OlmPool 里有好几个配置比它更强。

机制上,作者把注意力分布拆开看。没有 QK-norm 的模型会自发形成很强的 attention sink(把大量注意力堆在序列开头几个 token 上),注意力熵也更高,而这种 sink 行为反而和更好的长上下文成绩正相关(R²=0.38)。看起来 sink 是没有 QK-norm 的 transformer 用来吸收「多余注意力」的默认策略,QK-norm 恰恰压掉了它。滑窗则会削弱全局层的 sink 行为。

为什么重要

对从业者来说,如果长上下文对你的模型重要,那架构这件事得在预训练之前就筛,因为等到扩展阶段基本已经定了,而预训练仪表盘上没有任何东西会给你预警。最省事的筛查就是数这四个特征。最尖锐的结论是 QK-norm:一个为稳定性加的特性,同时也是单项里最大的可扩展性税,而且没法直接拆掉、得连 norm 顺序一起重做。GQA 是第二根杠杆:能多给 KV head 就给,长上下文会更好,这是把已知的效率/质量权衡又拧紧了一圈。

局限与存疑

规模是最大的保留。只测了 7B、只预训练 140B token,生产模型动辄几万亿。作者把最差的架构扩展到 50B token,它仍然追不上 Llama 架构,但没法排除在极端规模下差距会被抹平。「数四个特征」这个预测器是在 26 个模型、一个很窄的设计空间里拟合的,外推到 Olmo/Llama/Qwen 之外的取值没测过。检索头(retrieval head)分析没有定论,所有模型的检索得分都偏低,作者承认可能是模型还在预训练早期、太弱,不足以可靠识别检索头。整组实验花了约 17 万 H100 小时、约 42.6 吨二氧化碳当量,这种受控扫描成本很高、很难复现。而 sink 补偿「多余注意力」这条机制线是相关性的(sink 与 HELMET 的 R²=0.38),不是因果证明。

术语

原文与代码

社区讨论

相关论文

全部论文解读