PPO 曾被 NeurIPS 拒稿,如今成最常用 RL 算法引用超 4.5 万

IanArawjo · x · 2026-09-21

有人翻出旧事:强化学习算法 PPO 在 2017 年曾被 NeurIPS 拒稿,如今它已是世界上使用最广的 RL 算法,引用量超过 45,000 次。

发帖人由此感慨:在本届 ICLR 超过 6 万篇投稿的规模下,不知道有多少篇未来的「PPO」正在被拒。这是一则关于审稿制度与算法命运反差的 AI 圈经典轶事。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →