智谱唐杰谈扩展律:推理与 MoE 如何重塑最优比例

jietang · x · 2026-08-19

智谱唐杰撰文深度解析 Scaling Law 的演变。文章指出早期 Kaplan 法则导致参数过度扩张,随后 Chinchilla 将计算最优比例修正为 20:1,但随着推理成本主导,趋势转向更小模型通过长时间训练(如 Llama-2)来优化。

MoE 架构进一步改变了目标:总参数量决定知识储备,而激活参数量决定推理深度。Roberts (2025) 研究发现最优比例是任务依赖的,过度追求总参数量反而可能损害推理能力。

基于此,GLM-5.3 进行了控制实验:保持基础模型和参数不变,通过一个月的长视界环境强化学习(RL)和后训练,获得了非边际的性能提升,证明超越参数阈值后,有效深度和后训练才是关键。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →