智谱唐杰:后训练缩放定律与合成环境全流程
Latent Space · rss · 2026-08-20
Latent Space 摘要了智谱 AI CEO 唐杰关于 GLM 5.3 和后训练缩放定律的观点。
核心观点:
- 参数数失效:参数量仅在结合数据量、算力分配和运行条件时才有意义。
- 后训练缩放:推理范式下,记忆依赖参数,而推理依赖后训练数据和有效深度。GLM-5.3 的进步主要来自长周期环境中的 RL 训练。
全合成环境:
- 研究代理收集真实任务模式,转化为带有多步依赖和隐藏状态的可运行环境。
- 判定代理 尝试任务以确保可解性,合成验证器 提供二元奖励信号,无需参考解。
- 这实现了“合成到底” 的自我改进流程。
缩放旋钮: 唐杰提出了包括 MoE 稀疏度 (XA-YB) 在内的 5 个缩放维度,指出高级技能(如漏洞挖掘)需要维持 20+ 步的因果链,而非单纯依赖总参数量。
行业动态:
- 模型发布:Ornith-1.5 (MIT 协议) 发布 9B/35B/397B 版本,强调端到端自我改进。
- 压缩技术:UnslothAI 推出 1-bit 量化,保留 77% BF16 精度并能在 8GB RAM 运行。
- Agent Harness:DeepSeek Harness 被定位为开放的 Agent 运行时而非产品化助手;TrueFoundry 开源 TrueForge,声称可减少 30% Token 消耗。
「公司和人」频道最新
- KAIST 可扩展可信 AI 组开放 2027 秋季博士申请 — coallaoh · 2026-08-20
- OpenAI 用户停滞营收似 Databricks,被指依赖氛围经济 — willccbb · 2026-08-20
- 作者拟在书中披露 AI 辅助写作细节,对抗检测焦虑 — bratton · 2026-08-20
- Sanja Fidler 公开宣布 VeedaAI 后数小时即出席 Actuate — ZGojcic · 2026-08-20
- Cognition 总裁曾是特斯拉 Autopilot 基础设施架构师 — russelljkaplan · 2026-08-20
- 职场建议:保持创始人思维胜过追求产品经理职级 — DanGrover · 2026-08-20