KLPO免Critic智能体RL方法发布,自夸式宣传引群嘲
Yifan Zhang 发布论文与开源仓库 KLPO(KL-Regularized Policy Optimization),提出一种无需 Critic 的智能体强化学习方法。不过作者以「Q 已破解」「RL 科学终章」等自嘲式夸张表述宣传论文,引发网友群嘲,有人用 Pangram 玩梗称其并无实质结果,论文的营销方式反而成为讨论焦点。
2026-09-21 ~ 2026-09-21 · 2 条相关
- 作者以「Q* 已破解」自嘲式发帖,推出免 Critic 智能体 RL 方法 KLPO — inductionheads · 2026-09-21
- RL 论文自封「Q* 已解决、RL 科学终章」,遭网友群嘲 Pangram 玩梗无结果 — SonglinYang4 · 2026-09-21