微软研究员指出强化学习训练过度依赖正向激励

微软首席研究员 Alexia Jolicoeur 探讨了强化学习(RL)训练中业界仅关注正向激励的局限性。相关讨论指出,RL 训练忽视了负空间效应:大量崩溃或低奖励的 rollout 被直接丢弃,导致模型无法从失败中学习,进而引发潜在的能力退化问题。

2026-08-04 ~ 2026-08-04 · 2 条相关