专题 · FULL STORY

ModernBERT 长上下文之争与作者回应

社区围绕 ModernBERT 类模型的长上下文能力爆发争论,指出其仅使用滑窗注意力,调高 max_len 的实际效果存疑。随后模型作者 antoine_chaffin 回应称模型按 8k 上下文训练,可通过调整 RoPE theta 进一步扩展,争议暂告一段落。

2026-09-21 ~ 2026-09-21 · 2 集 · 7 条

第 1 集 · ModernBERT 长上下文之争:滑窗结构与8192上限引质疑(2026-09-21,5 条)

围绕一款 ModernBERT 类模型的长上下文能力,多位社区成员在 9 月 21 日展开争论。AIQuanting 指出该模型虽在 README 中宣称可将 maxlen 提升到 2048、4096 甚至 8192,但拉长配置并不能改变注意力结构本身:配置文件的 28 层中,有 18 层采用 128 token 的局部滑动窗口注意力,仅 10 层做全序列注意力。他还质疑实测口径:maxpositionembeddings 配置写着 8192,但模型卡片(context row)标注 512,agent 配置默认 maxlen 也为 512,宣传与实际使用存在落差。

已确认

  • 该模型 28 层中 18 层使用 128 token 滑动窗口注意力,10 层为全序列注意力(AIQuanting 依据配置文件指出)。
  • maxpositionembeddings 配置为 8192,而模型卡片标注 512、agent 默认 maxlen 为 512。
  • 模型作者 antoinechaffin 回应称,混合滑动窗口+全局注意力的长上下文性能与每层全注意力相当,区别只是计算成本更低。
  • JFPuget 解释称 8192 是模型本身支持的上限,若下游(如 laya 卡片、agent 配置)自行加了更小的限制,那是下游的选择而非模型能力问题。

为什么重要

  • 上下文长度是模型选型的关键指标,但配置字段、模型卡片与下游默认值之间的不一致容易造成误导,用户需区分「架构支持上限」与「实际生效长度」。
  • 滑动窗口+全局混合注意力在长上下文任务上是否能真正对齐全注意力性能,是低成本长上下文方案的核心争议点;作者以「性能持平、只是更便宜」回应,但社区对实测口径仍有分歧。

第 2 集 · 模型作者回应长上下文质疑:调 RoPE 可扩展(2026-09-21,2 条)

针对外界对其模型长上下文能力的质疑,模型作者 antoinechaffin 回应称,该模型按 8k 上下文训练,通过调整 RoPE theta 可进一步扩展上下文长度;README 默认 maxlen 为 512,可调至 2048/4096/8192 且不损害长上下文性能。他还强调,长上下文长期以来真正的瓶颈是训练数据的稀缺与成本,而非团队采用的混合局部+全局注意力结构。