GLM-5.2 博客透露,Z.ai 似乎放弃 GRPO 回到 PPO
bycloud · youtube · 2026-07-24
GLM-5.2 最值得看的不是分数,而是训练策略
这条视频的重点不只是 GLM-5.2 的表现,而是作者从 Z.ai 博客里挖到的训练细节。
核心观点是:
- 团队似乎已经停止使用 GRPO
- 转而回到 PPO
作者认为,这比单看模型榜单更能说明团队对 RL 优化的判断。视频本身夹杂了赞助和导流信息,但真正有价值的是对 GLM-5.2 训练路线的解读。
「模型」频道最新
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11