四个架构决策可致长上下文性能损失47%,新研究发布OlmPool

dair_ai · x · 2026-08-13

来自Ai2、卡内基梅隆大学和华盛顿大学的新研究发现,四个看似无害的架构决策——归一化、GQA、预训练上下文长度和滑动窗口注意力——组合起来可导致模型长上下文性能下降高达47%。这些决策在短上下文损失或验证集上不显现,因此常被忽视。研究团队发布了OlmPool,包含26个可比较的7B模型,训练耗时超过17万GPU小时,并提供了扩展前后的检查点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →