ModernBERT 架构细节:28 层中 18 层仅用 128 token 滑窗
AIQuanting · x · 2026-09-21
AIQuanting 补充指出,该模型配置文件里的 28 层并不均匀:18 层采用 128 token 的局部滑动窗口注意力,只有 10 层做全序列注意力。也就是说,尽管 maxpositionembeddings 支持到 8192,模型大部分层实际只做局部阅读。
后续对话进一步澄清:maxpositionembeddings: 8192 只是配置字段,下游 laya 系列卡片标 512、agent 配置限 512、laya-multilingual 等标 1024,实际可用上下文取决于具体部署,人为加的限制可以安全移除。
所属事件:ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(5 条相关)→
「模型」频道最新
- 实测 Codex computer use:Astra 稳定,Luna/Sol 频繁失灵 — FamilyNP · 2026-09-21
- 实测发现 service_tier=fast 仅限 API,ChatGPT 订阅通道不支持 — TrickyPlastic · 2026-09-21
- 中国开源模型 OpenRouter 消费额狂飙:Moonshot 涨 2425% — FinanceYF5 · 2026-09-21
- Yacine 吐槽:编程 LLM 产出全是不必要的复杂垃圾 — yacineMTB · 2026-09-21
- 研究者指出:LLM 写的 related work 很有说服力但不等于全面 — lucacarlone1 · 2026-09-21
- The Information:OpenAI 新模型 Astra 所用秘技引发安全担忧 — keviv9 · 2026-09-21