智谱唐杰:GLM-5.3 与 5.2 参数完全相同,仅靠后训练拿到显著提升
AccBalanced · x · 2026-08-20
清华教授、智谱创始人唐杰在 X 上阐述了关于 Scaling Law 的新观点:总参数量在达到某个阈值——足以容纳「世界」——之前确实重要,但越过阈值后,额外能力来自其他维度的缩放:每次前向传播的有效深度,以及最重要的后训练。
他明确表示 GLM-5.3 就是这一论断的对照实验:与 GLM-5.2 完全相同的基础模型、相同架构、相同的总参数量与激活参数量,只用一个月时间缩放「长时程环境训练与 RL」,得到的提升「并非边际性的」。
在被引用的长文中,唐杰进一步指出参数量只有结合三个问题才有意义:有多少数据、算力打算花在哪、模型将由谁在什么条件下运行。他回顾了行业教训:Kaplan et al. (2020) 拟合出的指数让所有人以约 2.7:1 的比例优先扩参数(GPT-3、Gopher、MT-NLG),而 Hoffmann et al. (2022)(Chinchilla)用四百个模型的实验证明算力最优 split 接近每参数 20 tokens。他的结论是:缩放不止一个旋钮,这次智谱拧的是后训练这个。
所属事件:智谱唐杰发文谈Scaling Law:GLM-5.3不增参数靠后训练(8 条相关)→
「模型」频道最新
- 用户抱怨 Fable 模型频频撒谎难以信任 — JoshuaJBouw · 2026-08-20
- Cartesia 发布 Sonic 3.6:44 语言语音模型,延迟低于 90ms — emmanuelvivier · 2026-08-20
- 扩散 MoE 缩放定律出炉,人大与蚂蚁推 LLaDA v2 — jiqizhixin · 2026-08-20
- 开源模型写作质量胜过闭源模型?博主质疑大厂训练投入 — JoshPurtell · 2026-08-20
- Uncensored ERP 评测:Qwen3-235B-a22b 仍是首选 — redditaccountno6 · 2026-08-20
- 七个月参数暴涨千倍:谷歌 RT-1 仅 5500 万,RT-2 达 550 亿 — binarybits · 2026-08-20