1M 上下文是纸面数字:模型有效上下文受内部维度限制远低于标称

AlexTensor · x · 2026-10-11

Chomba Bupe 提出并引发讨论的观点:模型在论文/规格中标注的最大上下文窗口(MCW,如 100 万 token)并不等于实际可用的上下文。真正的「最大有效上下文窗口」(MECW)受模型内部注意力计算维度 D 的限制,通常远低于标称值。引用者追问:是否可以认为即使是标称 1M token 的前沿模型,其「有效」窗口实际上也小得多?

该观点为发帖人个人分析,属对模型长上下文能力口径的质疑性讨论,非官方结论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →