KLPO免Critic智能体RL方法发布,自夸式宣传引群嘲

Yifan Zhang 发布论文与开源仓库 KLPO(KL-Regularized Policy Optimization),提出一种无需 Critic 的智能体强化学习方法。不过作者以「Q 已破解」「RL 科学终章」等自嘲式夸张表述宣传论文,引发网友群嘲,有人用 Pangram 玩梗称其并无实质结果,论文的营销方式反而成为讨论焦点。

2026-09-21 ~ 2026-09-21 · 2 条相关