RL训练忽视负空间:被丢弃的rollout与潜在能力退化

gerardsans · x · 2026-08-04

gerardsans在回复中深入阐述了RL训练中负空间的两个效应:1) 在RL过程中生成的大量rollout中,那些崩溃或低奖励的被直接丢弃,从未进入微调数据或评估,模型无法从失败中学习,这些影子轨迹被浪费;2) 更隐蔽的是,RL在奖励任务(如数学、代码)上重写概率分布,由于潜在空间高度纠缠,对正方向的强化会在未测试的输入上产生副作用,导致输出多样性下降、响应僵化、RL分布之外的能力退化。

所属事件:微软研究员指出强化学习训练过度依赖正向激励(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →