序列级 KL 估计器可为异步 RL 提供正确梯度
ZacharyHuang12 · x · 2026-07-26
这条线程讨论的是 RL 里“序列级优化”与“token 级训练”之间的不匹配:理论上我们想在整段序列上做优化,但实践里常常退化成按 token 更新。作者引用了一篇论文,指出这里真正重要的是 序列级 KL 估计器的梯度是否正确,而不是它的数值是否完全等于真实 KL。
要点包括:
- 论文给出了一个 梯度正确的序列级 KL estimator。
- 作者进一步推导了它如何用于 异步 RL,核心是如何用 importance sampling 保持估计无偏。
- 虽然序列级 importance sampling 会因为乘上整段 token 而方差很高,但推导显示,真正影响当前 token 更新的只有 它后面的未来 token。
- 结论是:importance sampling 的修正应该精确地作用在推导出的序列级回报项上,而不是粗暴地按 token 套用。
「编程与Agent」频道最新
- Anthropic 称内部 Slack agent 已写出产品团队 65% 代码 — VraserX · 2026-07-26
- Aethos Memory 让 Claude Code、Cursor 和 Windsurf 共用一套持久记忆 — Longjumping-Koala396 · 2026-07-26
- 面向编程智能体的 MCP 记忆服务开源,采用三段式 RAG 检索 — Longjumping-Koala396 · 2026-07-26
- IMO 2026 测试显示 harness 能提分,但前沿模型仍领先一大截 — pequalnp92 · 2026-07-26
- 提示词把任务拆成子代理,再用严苛评审反复迭代 — paul_cal · 2026-07-26
- 开源 Claude Code 技能让 CEO 和 QA 语音 Bot 进会议 — anand__balakrishnan · 2026-07-26