四个架构决策可致长上下文性能损失47%,新研究发布OlmPool
dair_ai · x · 2026-08-13
来自Ai2、卡内基梅隆大学和华盛顿大学的新研究发现,四个看似无害的架构决策——归一化、GQA、预训练上下文长度和滑动窗口注意力——组合起来可导致模型长上下文性能下降高达47%。这些决策在短上下文损失或验证集上不显现,因此常被忽视。研究团队发布了OlmPool,包含26个可比较的7B模型,训练耗时超过17万GPU小时,并提供了扩展前后的检查点。
「研究」频道最新
- Recast 出隐身:用 AI 天气模型执行超百次人工增雨作业 — louisvarge · 2026-08-13
- 从 PDB 恢复 6 万种蛋白质构象,最大实验性数据集发布 — CatAstro_Piyush · 2026-08-13
- 深度长文:模型终将吞噬整个工程框架 — pzakin · 2026-08-13
- PyTorch 核心开发者推出流水线并行调度可视化教学工具 — ezyang · 2026-08-13
- Sekai2 发布:超 2800 小时交互式世界模型大型视频数据集 — udmrzn · 2026-08-13
- AI合成内容泛滥,前AI时代的人类数据会更有价值吗? — ArcanuMELO · 2026-08-13