Critic 训练细节与稳定性

ziv_ravid · x · 2026-07-11

这段在讲一个 critic 的训练实现细节:

整体是在说明 agent/RL 训练里,怎样处理价值模型和轨迹上的数值不稳定问题。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →