智谱 GLM-5.3 官方长文:参数量之外,Scaling Law 还有别的旋钮

pmttyji · reddit · 2026-08-19

智谱 Z.ai 发布长文《Thoughts About Scaling Law》,并以 GLM-5.3 作为受控实验:与 GLM-5.2 相同的基座、架构、总参数与激活参数,仅用一个月放大长程环境与 RL 后训练,收益并非边际。

文章回顾了 scaling 认知演进:Kaplan et al. (2020) 拟合出参数增长快于数据(约 2.7:1),行业据此造出 GPT-3、Gopher、MT-NLG 等万亿参数模型;Hoffmann et al. (2022)(Chinchilla)用四百个模型重做实验,发现算力最优配比约为每参数 20 token,且算力充足时两者应同步增长——万忆参数一轮实为全行业的弯路。

后续演进:推理成本主导生命周期成本后,最优解转向小模型过度训练(Llama-2-7B、Gemma-2-9B 分别约 290 和 889 token/参数);MoE 时代总参数(决定知识容量)与激活参数/有效深度(决定推理链长度)需分开对待;Roberts et al. (2025) 发现最优 token/参数比与任务相关——记忆型任务偏好更多参数,推理型任务偏好更多数据,固定配比下推高总参数反而损害推理。

结论:总参数在达到"装下世界"的阈值后,增量能力来自有效深度与后训练。基座规模、预训练数据、单次前向算力都还在桌上,下次可能转向 mid-training 或 pre-training。

所属事件:智谱唐杰长文解析 Scaling Law:参数量之外还有新旋钮(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →