GLM-5.2 博客透露,Z.ai 似乎放弃 GRPO 回到 PPO
bycloud · youtube · 2026-07-24
GLM-5.2 最值得看的不是分数,而是训练策略
这条视频的重点不只是 GLM-5.2 的表现,而是作者从 Z.ai 博客里挖到的训练细节。
核心观点是:
- 团队似乎已经停止使用 GRPO
- 转而回到 PPO
作者认为,这比单看模型榜单更能说明团队对 RL 优化的判断。视频本身夹杂了赞助和导流信息,但真正有价值的是对 GLM-5.2 训练路线的解读。
「模型」频道最新
- Polymarket 称博士生用 GPT-5.6 Sol 五天解 6 个 Erdős 问题 — Polymarket · 2026-07-24
- Opus 5 还没官宣就被传要碾压 Opus 4.8 — vasuman · 2026-07-24
- 一堂技术 AI 速成课串起 LLM、MCP、Agent 与 RAG — aakashgupta · 2026-07-24
- 大模型总爱自作主张?开发者痛斥指令遵循痛点 — Unnamed-3891 · 2026-07-24
- Gemini 3.5 Flash 已能生成较忠实的 Minecraft 克隆 — majidmanzarpour · 2026-07-24
- ChatGPT 结账配置曝光新的 Business ProLite 套餐 — btibor91 · 2026-07-24