大模型长上下文能力衰退严重,Token 效率差异揭示黑盒难题

zakelfassi · x · 2026-08-30

作者指出,单纯追求 1M 等大上下文窗口已不再令人印象深刻,因为观察发现模型在上下文扩大时性能显著下降(如 GPT-5.6 Sol 在 NIAH 任务中从 128K 的 92.4% 跌至 512K 的 61.9%)。不同模型家族在不同任务下的 token 效率表现差异巨大,这表明我们对模型内部机制的理解仍处于皮毛阶段,未来可能衍生出 2-3 个新学科来研究这些现象。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →