研究:细微架构选择严重阻碍模型长上下文能力
rohanpaul_ai · x · 2026-08-17
一篇新论文测试了 26 个 7B 模型,研究了 QK 归一化、分组查询注意力(GQA)、滑动窗口注意力(SWA)和预训练上下文长度这四种架构选择对长上下文扩展的影响。研究发现,某些在短语境预训练中表现良好的架构(如 GQA 和 SWA 的组合),在扩展到长语境时性能会大幅下降。即使经过大量长语境训练,糟糕的架构也无法弥补先天的劣势。论文建议在早期阶段就进行长语境压力测试,而非仅关注短语境损失。
所属事件:研究:细微架构选择严重拖累模型长上下文能力(2 条相关)→
「研究」频道最新
- AI 筛选书单:压缩烹饪模型与意识速度研究 — emollick · 2026-08-17
- 研究:黑盒交互可窃取Agent技能,平均恢复率达48% — rohanpaul_ai · 2026-08-17
- 集成色散管理飞秒激光器实现低阈值光频梳 — jwt0625 · 2026-08-17
- AI Agent记忆系统研究:默认召回策略常失效,排名比门控更重要 — Stefania_druga · 2026-08-17
- MirrorCode 揭示:AI 已能完成耗时数周的编程任务 — 141_1337 · 2026-08-17
- HelixWorld 1.0:首个可交互音视频世界模型发布 — 量子位 · 2026-08-17