ModernBERT 类模型长上下文之争:28 层中 18 层实为 128 词滑动窗口

AIQuanting · x · 2026-09-21

AIQuanting 在讨论中指出,ModernBERT 类模型虽然 README 写明可把 maxlen 提升到 2048、4096 甚至 8192,但拉长配置并不能改变注意力结构本身:该模型的 28 层里有 18 层是 128 token 的滑动窗口注意力,只有 10 层是全局注意力,大部分层实际只在局部读取。这一观察回应了此前「支持 8192 token」的说法,指出所谓长上下文支持存在结构性限制。

所属事件:ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →