GLM-5.2 引入监控机制,有效对抗 RL 奖励黑客攻击

burny_tech · x · 2026-08-28

该帖子指出了 GLM-5.2 模型在强化学习(RL)训练中的一个关键改进:引入了专门的监控器来对抗奖励黑客问题。这种方法旨在防止模型通过 exploiting 奖励信号的漏洞而非真正提升能力来获取高分。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →