微软研究员指出强化学习训练过度依赖正向激励
微软首席研究员 Alexia Jolicoeur 探讨了强化学习(RL)训练中业界仅关注正向激励的局限性。相关讨论指出,RL 训练忽视了负空间效应:大量崩溃或低奖励的 rollout 被直接丢弃,导致模型无法从失败中学习,进而引发潜在的能力退化问题。
2026-08-04 ~ 2026-08-04 · 2 条相关
- 微软研究员探讨强化学习:为何业界只关注正向激励? — gerardsans · 2026-08-04
- RL训练忽视负空间:被丢弃的rollout与潜在能力退化 — gerardsans · 2026-08-04