Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension
Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld
COLM 2026
cs.CL
2026-08-11
预训练 26 个数据/优化器全固定、仅架构不同的 7B 模型,四个常见选择(QK-norm、GQA、滑窗注意力、4K 预训练)叠加让长上下文 HELMET 最多掉 47%,短上下文指标全预测不到。
长上下文现在几乎是标配,但把一个预训练好的模型扩到 64K 以上是件很看运气的事。Llama 3 扩起来很顺,Olmo 就费劲。这个差距到底来自架构,还是来自 Llama 3 没公开的预训练数据,一直没定论。更实际的问题是:预训练阶段能不能早点看出一个模型将来好不好扩?这篇给的答案是——任何标准预训练指标都看不出来,而真正决定它的,是一组所有人都当作小事的架构选择。
核心是一组高度受控的预训练实验,产物叫 OlmPool:26 个 7-8B 的模型。每个都先预训练 140B token(Chinchilla 最优数据量),再用 Longmino 数据混合做 10B token、64K 上下文的扩展,期间调整 RoPE theta。26 个模型的数据选择与顺序、优化器、学习率调度、分词器全部一致,只有四个轴在变,而且取值只来自 Llama 2/3、Qwen 3、Olmo 3 真正用过的:
选这四个,是因为它们既在近期主流模型之间真正有分歧,又都直接挂在注意力机制或上下文长度上。把其余一切固定,才能把架构从数据里剥出来。
一个容易被忽略的耦合:QK-norm 是为训练稳定性加的。作者实测,post-sublayer-norm 且不加 QK-norm 的组合在 140B token 之前就发散了。所以「移除 QK-norm」在实际里等于「移除 QK-norm 并换回 prenorm」。这是个真实的取舍,不是白捡的好处。
26 个模型在 HELMET 32K 上的分数从 29.9 到 56.4,RULER 32K 从 44.7 到 67.7。同样的数据,仅凭架构就拉出了 26.5 分、约 47% 的差距。
叠加效应是全文的重心。每个特征单独看都很轻:4K 对 8K 预训练掉 1-2 分;单独加滑窗掉 1.1 分;GQA 随 KV head 数变化,比 Llama 3 的 8 个 KV head 多就更好、少就更差;QK-norm 是单个杠杆里最大的,从 Olmo 移除(配合 prenorm)涨 6 分,加到 Llama 3 上掉 3.8 分。但叠在一起就是超线性恶化:滑窗配 GQA 平均掉 9 分(单独滑窗才掉 1.1),最差的那个配置是 GQA + 滑窗 + headwise QK-norm 三件套。
最有用的预测器反而最糙:数一下一个模型占了几样这四个特征。这一个数字就拿到 R²=0.67(留一 0.61),比在四个轴上跑线性回归还准。四个全占未必比占三个更差,因为有些特征作用重叠——4K 滑窗在预训练期里看起来和直接 4K 预训练很像。
标准预训练指标对这件事几乎瞎:
| 指标 | 与 32K HELMET 的 R² |
| 预训练训练损失 | 0.29 |
| 扩展阶段损失 | 0.06 |
| WikiText 困惑度(最佳内在指标) | 0.39 |
| 16 个短上下文 benchmark 均值 | 0.17 |
| 扩展前 HELMET 8K | 0.32 |
| 四特征计数 | 0.67(留一 0.61) |
连最贴近的「扩展前 HELMET 8K」也只有 0.32,看不到两位数的跌幅来。Llama 3 的好扩是架构属性不是数据红利:它的架构在设计空间里名列前茅,而 OlmPool 里有好几个配置比它更强。
机制上,作者把注意力分布拆开看。没有 QK-norm 的模型会自发形成很强的 attention sink(把大量注意力堆在序列开头几个 token 上),注意力熵也更高,而这种 sink 行为反而和更好的长上下文成绩正相关(R²=0.38)。看起来 sink 是没有 QK-norm 的 transformer 用来吸收「多余注意力」的默认策略,QK-norm 恰恰压掉了它。滑窗则会削弱全局层的 sink 行为。
对从业者来说,如果长上下文对你的模型重要,那架构这件事得在预训练之前就筛,因为等到扩展阶段基本已经定了,而预训练仪表盘上没有任何东西会给你预警。最省事的筛查就是数这四个特征。最尖锐的结论是 QK-norm:一个为稳定性加的特性,同时也是单项里最大的可扩展性税,而且没法直接拆掉、得连 norm 顺序一起重做。GQA 是第二根杠杆:能多给 KV head 就给,长上下文会更好,这是把已知的效率/质量权衡又拧紧了一圈。
规模是最大的保留。只测了 7B、只预训练 140B token,生产模型动辄几万亿。作者把最差的架构扩展到 50B token,它仍然追不上 Llama 架构,但没法排除在极端规模下差距会被抹平。「数四个特征」这个预测器是在 26 个模型、一个很窄的设计空间里拟合的,外推到 Olmo/Llama/Qwen 之外的取值没测过。检索头(retrieval head)分析没有定论,所有模型的检索得分都偏低,作者承认可能是模型还在预训练早期、太弱,不足以可靠识别检索头。整组实验花了约 17 万 H100 小时、约 42.6 吨二氧化碳当量,这种受控扫描成本很高、很难复现。而 sink 补偿「多余注意力」这条机制线是相关性的(sink 与 HELMET 的 R²=0.38),不是因果证明。