论文横评 26 个 7B 模型:省算力的架构反而不擅长长上下文

eyishazyer · x · 2026-08-17

该论文在固定数据、tokenizer 和上下文扩展方案的前提下,对比了 26 个规模均为 7B 的可比模型,唯一变量是 4 种架构选择。核心发现:一些让 transformer 更便宜、更稳定的架构选择,反而使其更难扩展到长上下文——模型在短上下文预训练中表现完全正常,仍可能不适合后续做长上下文。发帖人据此评论:短上下文 benchmark 显然没讲出全貌,长上下文压力测试应当更早进行。

所属事件:研究:细微架构选择严重拖累模型长上下文能力(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →