研究:细微架构选择严重拖累模型长上下文能力

一篇新论文在固定数据、tokenizer 和上下文扩展方案的前提下,对 26 个规模均为 7B 的可比模型进行横评,唯一变量是 QK 归一化、分组查询注意力(GQA)、滑动窗口注意力(SWA)和预训练上下文长度这四种架构选择。研究发现,一些让 transformer 更省算力的设计反而明显损害模型的长上下文扩展能力,表明细微的架构决策对长上下文性能影响重大。

2026-08-17 ~ 2026-08-17 · 2 条相关