多力度 RL 训练:用 R = S − λ_e·C 奖励整体抬升 Pareto 前沿

carlesgelada · x · 2026-09-12

Carles Gelada 发起讨论:其团队目标是通过多力度(multi-effort)RL 训练把整条 Pareto 前沿向上推。他们从第一性原理推导出奖励应为 R = S − λe·C,其中 S∈{0,1} 表示 rollout 是否解题成功,C 为 rollout 成本,λe 是按力度变化的成本惩罚系数。后续推文给出了 λe 的具体取值方法。

所属事件:RL 奖励设计:λ_e 相切以抬升 Pareto 前沿(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →