混合注意力长上下文性能与全注意力持平,作者称「只是更便宜」
antoine_chaffin · x · 2026-09-21
在关于其模型长上下文的讨论中,作者 antoinechaffin 回应质疑称:混合滑动窗口+全局注意力并非问题,长上下文性能与每层全注意力相当,「只是更便宜」。此前 AIQuanting 指出该模型 28 层中 18 层是 128 token 滑动窗口、仅 10 层全局注意力,即使支持 8192 token 也大部分在局部读取。
所属事件:ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(5 条相关)→
「模型」频道最新
- 实测 Codex computer use:Astra 稳定,Luna/Sol 频繁失灵 — FamilyNP · 2026-09-21
- 实测发现 service_tier=fast 仅限 API,ChatGPT 订阅通道不支持 — TrickyPlastic · 2026-09-21
- 中国开源模型 OpenRouter 消费额狂飙:Moonshot 涨 2425% — FinanceYF5 · 2026-09-21
- Yacine 吐槽:编程 LLM 产出全是不必要的复杂垃圾 — yacineMTB · 2026-09-21
- 研究者指出:LLM 写的 related work 很有说服力但不等于全面 — lucacarlone1 · 2026-09-21
- The Information:OpenAI 新模型 Astra 所用秘技引发安全担忧 — keviv9 · 2026-09-21