智谱唐杰:GLM-5.3 与 5.2 参数完全相同,仅靠后训练拿到显著提升

AccBalanced · x · 2026-08-20

清华教授、智谱创始人唐杰在 X 上阐述了关于 Scaling Law 的新观点:总参数量在达到某个阈值——足以容纳「世界」——之前确实重要,但越过阈值后,额外能力来自其他维度的缩放:每次前向传播的有效深度,以及最重要的后训练。

他明确表示 GLM-5.3 就是这一论断的对照实验:与 GLM-5.2 完全相同的基础模型、相同架构、相同的总参数量与激活参数量,只用一个月时间缩放「长时程环境训练与 RL」,得到的提升「并非边际性的」。

在被引用的长文中,唐杰进一步指出参数量只有结合三个问题才有意义:有多少数据、算力打算花在哪、模型将由谁在什么条件下运行。他回顾了行业教训:Kaplan et al. (2020) 拟合出的指数让所有人以约 2.7:1 的比例优先扩参数(GPT-3、Gopher、MT-NLG),而 Hoffmann et al. (2022)(Chinchilla)用四百个模型的实验证明算力最优 split 接近每参数 20 tokens。他的结论是:缩放不止一个旋钮,这次智谱拧的是后训练这个。

所属事件:智谱唐杰发文谈Scaling Law:GLM-5.3不增参数靠后训练(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →