反驳模型缩小论:2T 参数成新常态,KV 缓存年降 10 倍

zephyr_z9 · x · 2026-09-02

关于 AI 模型参数规模趋势的讨论。作者反驳了参数减少的观点,指出趋势始终是优化 + 更多参数。虽然 GPT-4 之后出现过规模下降,但 Fable/Spud、Astra、Kimi 和 Qwen 3.8 Max 等新模型已跨过 2T 参数大关。作者认为核心争议在于未来是需要 100T 参数还是 25T 的循环 Transformer。同时指出 KV cache 每个 token 的占用每年至少减少 10 倍(以 DeepSeek 为例),但上下文长度正从 32k 持续增长至 1M。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →