RL 奖励设计:λ_e 相切以抬升 Pareto 前沿
Carles Gelada 介绍其团队在多力度(multi-effort)RL 训练中的奖励设计:目标是把整条成本-性能 Pareto 前沿向上推,而非只优化单点。他们从第一性原理推导出奖励应为 R = S − λe·C,并给出几何解释:λe 决定 iso-reward 线的斜率,只有当这些线与 Pareto 曲线相切时,训练才能整体抬升前沿。
2026-09-12 ~ 2026-09-12 · 3 条相关
- 多力度 RL 训练:用 R = S − λ_e·C 奖励整体抬升 Pareto 前沿 — carlesgelada · 2026-09-12
- 将成本写进奖励:λ_e 取 Pareto 曲线斜率以整体抬升前沿 — carlesgelada · 2026-09-12
- 为什么 λ_e 必须与 Pareto 曲线相切:RL 抬升前沿的几何解释 — carlesgelada · 2026-09-12