RL 论文自封「Q* 已解决、RL 科学终章」,遭网友群嘲 Pangram 玩梗无结果

SonglinYang4 · x · 2026-09-21

Yifan Zhang 发布论文《KL-Regularized Policy Optimization for Critic-Free Agentic Reinforcement Learning》,自称从 GPO、SPPO、RPG 到 BPO 与 Score Centering,「RL 科学与 Q 的宏大终章终于到来」。Joel Bot 转发嘲讽:论文前两段 100% 命中 pangram(全字母句),却没有实验结果,称其为「无耻之尤」。这是一场围绕夸大宣传与 AI slop 论文的圈内争议。

所属事件:KLPO免Critic智能体RL方法发布,自夸式宣传引群嘲(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →