研究:细微架构选择严重拖累模型长上下文能力
一篇新论文在固定数据、tokenizer 和上下文扩展方案的前提下,对 26 个规模均为 7B 的可比模型进行横评,唯一变量是 QK 归一化、分组查询注意力(GQA)、滑动窗口注意力(SWA)和预训练上下文长度这四种架构选择。研究发现,一些让 transformer 更省算力的设计反而明显损害模型的长上下文扩展能力,表明细微的架构决策对长上下文性能影响重大。
2026-08-17 ~ 2026-08-17 · 2 条相关
- 研究:细微架构选择严重阻碍模型长上下文能力 — rohanpaul_ai · 2026-08-17
- 论文横评 26 个 7B 模型:省算力的架构反而不擅长长上下文 — eyishazyer · 2026-08-17