智谱唐杰谈扩展律:推理与 MoE 如何重塑最优比例
jietang · x · 2026-08-19
智谱唐杰撰文深度解析 Scaling Law 的演变。文章指出早期 Kaplan 法则导致参数过度扩张,随后 Chinchilla 将计算最优比例修正为 20:1,但随着推理成本主导,趋势转向更小模型通过长时间训练(如 Llama-2)来优化。
MoE 架构进一步改变了目标:总参数量决定知识储备,而激活参数量决定推理深度。Roberts (2025) 研究发现最优比例是任务依赖的,过度追求总参数量反而可能损害推理能力。
基于此,GLM-5.3 进行了控制实验:保持基础模型和参数不变,通过一个月的长视界环境强化学习(RL)和后训练,获得了非边际的性能提升,证明超越参数阈值后,有效深度和后训练才是关键。
「模型」频道最新
- Inkling-Small 登榜 Agent Arena,价格减半性能持平 — simonguozirui · 2026-08-19
- Maxime Labonne 宣布 LFM2.5 系列模型及 Embedding 模型上线 OpenRouter — maximelabonne · 2026-08-19
- 未来能否在小显存 GPU 上运行 30B+ 参数的大模型? — absurdother · 2026-08-19
- 实测 Grok 4.6:速度快到减少上下文切换,用户愿弃 Codex 换订阅 — elonmusk · 2026-08-19
- 澄清误区:Pangram 并非衡量写作好坏的标准 — TuhinChakr · 2026-08-19
- Gemini 3.7 Flash 速度提升,任务耗时大幅缩短 — rakyll · 2026-08-19