将成本写进奖励:λ_e 取 Pareto 曲线斜率以整体抬升前沿

carlesgelada · x · 2026-09-12

Carles Gelada 介绍其团队在多力度(multi-effort)RL 训练中的奖励设计:目标是把整条 Pareto 前沿往上推,奖励设为 R = S − λe·C,其中 S∈{0,1} 表示题目解决/失败,C 为 rollout 成本,λe 是与力度挂钩的成本惩罚系数。关键结论:λe 的正确取值是基座模型在对应力度下 Pareto 曲线的斜率——他们从基座模型近似估计这些值,并在整个 RL 训练过程中保持不变。原因在于 λe 决定 iso-reward 线(成本-性能平面上奖励相同的点连线)的斜率,只有当这些线与 Pareto 曲线相切时,提升奖励才能保证整体抬升前沿。

所属事件:RL 奖励设计:λ_e 相切以抬升 Pareto 前沿(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →