作者以「Q* 已破解」自嘲式发帖,推出免 Critic 智能体 RL 方法 KLPO

inductionheads · x · 2026-09-21

Yifan Zhang 发布新论文与开源仓库 KLPO(KL-Regularized Policy Optimization for Critic-Free Agentic RL),标题用「Q has been solved」「RL 科学的盛大终章」等夸张措辞,带有明显的圈内自嘲/梗意味,但方法本身是正经的:

代码在 GitHub 开源(yifanzhang-pro/KLPO),附技术报告与训练指南。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →