RL 奖励设计:λ_e 相切以抬升 Pareto 前沿

Carles Gelada 介绍其团队在多力度(multi-effort)RL 训练中的奖励设计:目标是把整条成本-性能 Pareto 前沿向上推,而非只优化单点。他们从第一性原理推导出奖励应为 R = S − λe·C,并给出几何解释:λe 决定 iso-reward 线的斜率,只有当这些线与 Pareto 曲线相切时,训练才能整体抬升前沿。

2026-09-12 ~ 2026-09-12 · 3 条相关