微软研究员探讨强化学习:为何业界只关注正向激励?

gerardsans · x · 2026-08-04

在一档学术访谈节目中,主持人邀请了微软首席研究员、Tiny Recursive Model(曾在 ARC-AGI-1 取得 45% 成绩并获奖)的作者 Alexia Jolicoeur-Martineau 探讨强化学习(RL)。

针对社区提问,主持人抛出了一个深刻的问题:当前的 AI 行业在应用强化学习时,往往只关注正向激励带来的性能提升,却忽略了那些在 RL 训练过程中崩溃、且未被纳入微调数据集或评估流程的 rollout 所产生的负面影响。

所属事件:微软研究员指出强化学习训练过度依赖正向激励(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →