ModernBERT 架构细节:28 层中 18 层仅用 128 token 滑窗

AIQuanting · x · 2026-09-21

AIQuanting 补充指出,该模型配置文件里的 28 层并不均匀:18 层采用 128 token 的局部滑动窗口注意力,只有 10 层做全序列注意力。也就是说,尽管 maxpositionembeddings 支持到 8192,模型大部分层实际只做局部阅读。

后续对话进一步澄清:maxpositionembeddings: 8192 只是配置字段,下游 laya 系列卡片标 512、agent 配置限 512、laya-multilingual 等标 1024,实际可用上下文取决于具体部署,人为加的限制可以安全移除。

所属事件:ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →