序列级 KL 估计器可为异步 RL 提供正确梯度

ZacharyHuang12 · x · 2026-07-26

这条线程讨论的是 RL 里“序列级优化”与“token 级训练”之间的不匹配:理论上我们想在整段序列上做优化,但实践里常常退化成按 token 更新。作者引用了一篇论文,指出这里真正重要的是 序列级 KL 估计器的梯度是否正确,而不是它的数值是否完全等于真实 KL。

要点包括:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →