作者以「Q* 已破解」自嘲式发帖,推出免 Critic 智能体 RL 方法 KLPO
inductionheads · x · 2026-09-21
Yifan Zhang 发布新论文与开源仓库 KLPO(KL-Regularized Policy Optimization for Critic-Free Agentic RL),标题用「Q has been solved」「RL 科学的盛大终章」等夸张措辞,带有明显的圈内自嘲/梗意味,但方法本身是正经的:
- FlashREINFORCE / KLPO:面向智能体语言模型的免 Critic(critic-free)、单 rollout、异步强化学习方法
- 主张强化学习就该用 REINFORCE:超智能应从经验中学习
- 默认实现为 token 回归 + Monte Carlo KL(MC-KL):用终止奖励提供反馈,在已访问前缀处做独立辅助 token 采样来估计 score 校正,无需同 prompt 响应组、也无需学习价值或归一化模型
- 每 prompt 只需一条完整响应即可训练
代码在 GitHub 开源(yifanzhang-pro/KLPO),附技术报告与训练指南。
「研究」频道最新
- 开源 mini Jev:仅 1.05MB 决策头让 Agent 直接输出动作概率 — AlternativeSure2891 · 2026-09-21
- 按关系亲疏为他人赋权重的计算模型并非新想法:学者引论文反驳 — xuanalogue · 2026-09-21
- 变换器并行计算论文被指漏洞:MLP 规模未被计入复杂度上界 — kfountou · 2026-09-21
- 机器人排行榜遭质疑:每任务仅 5 次试验,作者承诺扩到 15 次 — YuXiang_IRVL · 2026-09-21
- 表格基础模型入局,被调侃「等你发现 xgboost 就晚了」 — burny_tech · 2026-09-21
- LLM 能画 DAG 但保证不了 d-分离:结构学习的技术边界 — fdellaert · 2026-09-21