ModernBERT 类模型长上下文之争:28 层中 18 层实为 128 词滑动窗口
AIQuanting · x · 2026-09-21
AIQuanting 在讨论中指出,ModernBERT 类模型虽然 README 写明可把 maxlen 提升到 2048、4096 甚至 8192,但拉长配置并不能改变注意力结构本身:该模型的 28 层里有 18 层是 128 token 的滑动窗口注意力,只有 10 层是全局注意力,大部分层实际只在局部读取。这一观察回应了此前「支持 8192 token」的说法,指出所谓长上下文支持存在结构性限制。
所属事件:ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(5 条相关)→
「模型」频道最新
- Reddit 玩梗:Grok 逐年变笨,本地 MiniMax 3 反而更好用 — Mystvearn_ · 2026-09-21
- 两年前 sam 说智能将廉价到忽略不计,如今 10/50 美元成新常态 — teortaxesTex · 2026-09-21
- Gary Marcus:所谓通用模型一旦分布外就现原形 — GaryMarcus · 2026-09-21
- AI 编造乘客中间名,险些让人上不了飞机 — menhguin · 2026-09-21
- Qwen3.8-35B-A3B 蒸馏版 GGUF 量化模型登上 HF 热榜 — empero-ai · 2026-09-21
- 用户怒批 OpenAI Codex 重置机制:付费却不知限额何时恢复 — StewartalsopIII · 2026-09-21