Yacine 指出 GRPO 并非真正的强化学习

yacineMTB · x · 2026-08-01

AI 研究者 Yacine 在推文中直言,当前在推理模型训练中被广泛采用的 GRPO 算法,在严格意义上并不能算作真正的强化学习(RL)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →