ZAI 被指利用 GLM 模型高效生成 RL 环境

scaling01 · x · 2026-08-21

有观点认为 ZAI 可能找到了利用 GLM-5.2/5.3 高效生成强化学习(RL)环境的方法。作者建议通过绘制各实验室 RL 环境数量随时间变化的曲线来分析,认为这一指标可能解释 90% 的模型进展和实验室排名差异。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →