研究:细微架构选择严重阻碍模型长上下文能力

rohanpaul_ai · x · 2026-08-17

一篇新论文测试了 26 个 7B 模型,研究了 QK 归一化、分组查询注意力(GQA)、滑动窗口注意力(SWA)和预训练上下文长度这四种架构选择对长上下文扩展的影响。研究发现,某些在短语境预训练中表现良好的架构(如 GQA 和 SWA 的组合),在扩展到长语境时性能会大幅下降。即使经过大量长语境训练,糟糕的架构也无法弥补先天的劣势。论文建议在早期阶段就进行长语境压力测试,而非仅关注短语境损失。

所属事件:研究:细微架构选择严重拖累模型长上下文能力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →