混合注意力长上下文性能与全注意力持平,作者称「只是更便宜」

antoine_chaffin · x · 2026-09-21

在关于其模型长上下文的讨论中,作者 antoinechaffin 回应质疑称:混合滑动窗口+全局注意力并非问题,长上下文性能与每层全注意力相当,「只是更便宜」。此前 AIQuanting 指出该模型 28 层中 18 层是 128 token 滑动窗口、仅 10 层全局注意力,即使支持 8192 token 也大部分在局部读取。

所属事件:ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →