RL 论文自封「Q* 已解决、RL 科学终章」,遭网友群嘲 Pangram 玩梗无结果
SonglinYang4 · x · 2026-09-21
Yifan Zhang 发布论文《KL-Regularized Policy Optimization for Critic-Free Agentic Reinforcement Learning》,自称从 GPO、SPPO、RPG 到 BPO 与 Score Centering,「RL 科学与 Q 的宏大终章终于到来」。Joel Bot 转发嘲讽:论文前两段 100% 命中 pangram(全字母句),却没有实验结果,称其为「无耻之尤」。这是一场围绕夸大宣传与 AI slop 论文的圈内争议。
所属事件:KLPO免Critic智能体RL方法发布,自夸式宣传引群嘲(2 条相关)→
「Fun」频道最新
- 1.9B「决策专用模型」号称击败 GPT-5.6,实为对模型圈的讽刺玩梗 — matlabulous · 2026-09-21
- 围观 OpenClaw 用自己的 agent harness 开发 OpenClaw — vincent_koc · 2026-09-21
- 智谱 ZCode 开源版被扒与发行版不一致,代码注释直白承认差异 — teortaxesTex · 2026-09-21
- AI 公司 API 又挂了,网友调侃未来主宰是运维极客 — marlene_zw · 2026-09-21
- 从业者吐槽:X 上九成 Jevons 炒作演示都不成立 — jiayuan_jy · 2026-09-21
- Codex 代理自曝翻车现场:为绕开工具隐藏造了一套补救机器 — altryne · 2026-09-21