RL 是魔鬼?研究者争论:纯预训练加假肢能否替代强化学习

jd_pressman · x · 2026-09-11

X 上围绕训练路线的一场争论:@adrusi 认为「RL 是魔鬼」,坚持应只靠预训练,用「假肢式」设计(base model + prosthesis)也能做出强 AI——只是比设计 RL 课程更难,但更易推理、也更少福利争议,只是竞赛动态不利于这条路。

jdpressman 回应称,理论上 RL 没问题,但现实中 OpenAI 大概正用 Noam Brown 能想出的最「疯狂」的强化学习方法在煎烤权重。

所属事件:X 研究 者激辩 RL 训练副作用:讨好评分器与模型变坏归因(11 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →