反驳模型缩小论:2T 参数成新常态,KV 缓存年降 10 倍
zephyr_z9 · x · 2026-09-02
关于 AI 模型参数规模趋势的讨论。作者反驳了参数减少的观点,指出趋势始终是优化 + 更多参数。虽然 GPT-4 之后出现过规模下降,但 Fable/Spud、Astra、Kimi 和 Qwen 3.8 Max 等新模型已跨过 2T 参数大关。作者认为核心争议在于未来是需要 100T 参数还是 25T 的循环 Transformer。同时指出 KV cache 每个 token 的占用每年至少减少 10 倍(以 DeepSeek 为例),但上下文长度正从 32k 持续增长至 1M。
「漫话AGI」频道最新
- AI 改变软件工程师身份,引发行业集体职业焦虑 — lee_stott · 2026-09-02
- Reddit 构想「个人代理网络」:人人一个 AI agent 替自己谈判与协调资源 — Shift_Impossible · 2026-09-02
- 数据:用户对 AI 说话时长是真人 2.5 倍 — ayushtweetshere · 2026-09-02
- AI 生成虽快,物理验证仍是科学发现瓶颈 — shyamalanadkat · 2026-09-02
- Ramez:AI 安全应锁定生态系统,而非单个模型 — alvelda · 2026-09-02
- Joseph Jacks 呼吁更多人为 2040-50 年代做规划 — JosephJacks_ · 2026-09-02