大模型长上下文能力衰退严重,Token 效率差异揭示黑盒难题
zakelfassi · x · 2026-08-30
作者指出,单纯追求 1M 等大上下文窗口已不再令人印象深刻,因为观察发现模型在上下文扩大时性能显著下降(如 GPT-5.6 Sol 在 NIAH 任务中从 128K 的 92.4% 跌至 512K 的 61.9%)。不同模型家族在不同任务下的 token 效率表现差异巨大,这表明我们对模型内部机制的理解仍处于皮毛阶段,未来可能衍生出 2-3 个新学科来研究这些现象。
「模型」频道最新
- heretic:全自动给大模型「去审查」,GitHub 已近 2.9 万星 — p-e-w · 2026-08-30
- 实测:少量配置即可让 Claude 协助盗版与逆向工程 — adonis_singh · 2026-08-30
- 前员工直言:浏览器使用OpenAI碾压,Claude只剩编码强项 — bindureddy · 2026-08-30
- Claude Opus 5 评测:基准飙升但日活体验翻车 — gerardsans · 2026-08-30
- 「字母b的曲线对模型不可见」:分词盲区梗再翻红 — rickasaurus · 2026-08-30
- LLM 幽默感评测:Gemini 3.7 略胜 GPT-4o 最差 — scaling01 · 2026-08-30