强化学习数学系列第 14 期:基线、优势函数与 Actor-Critic
ShawnHymel · x · 2026-08-20
这是强化学习数学系列的第 14 部分。文章深入讲解了如何通过从回报中减去基线来降低方差,从而推导出优势函数,并阐述了 Actor-Critic 架构作为下一步的逻辑演进。
所属事件:强化学习数学系列第14期讲解优势函数与Actor-Critic(2 条相关)→
「研究」频道最新
- AI 探索生物推理:LLM 能否无需外置模型预测药物扰动 — willccbb · 2026-08-20
- 新方法 ROR:训练中动态切换优化器 — RichmanRonald · 2026-08-20
- FACET:在终端任务合成中保留意图与可执行状态 — Kou Shi · 2026-08-20
- 微调 Gemma 4 26B 提炼判决要旨,始终打不过基座模型 — seruZ12 · 2026-08-20
- Cerebras CS-4 探索新解耦架构:混合线性模型分层部署 — AccBalanced · 2026-08-20
- DeepSeek 发布 R1 模型,用强化学习激励 LLM 推理能力 — natanielruizg · 2026-08-20