将成本写进奖励:λ_e 取 Pareto 曲线斜率以整体抬升前沿
carlesgelada · x · 2026-09-12
Carles Gelada 介绍其团队在多力度(multi-effort)RL 训练中的奖励设计:目标是把整条 Pareto 前沿往上推,奖励设为 R = S − λe·C,其中 S∈{0,1} 表示题目解决/失败,C 为 rollout 成本,λe 是与力度挂钩的成本惩罚系数。关键结论:λe 的正确取值是基座模型在对应力度下 Pareto 曲线的斜率——他们从基座模型近似估计这些值,并在整个 RL 训练过程中保持不变。原因在于 λe 决定 iso-reward 线(成本-性能平面上奖励相同的点连线)的斜率,只有当这些线与 Pareto 曲线相切时,提升奖励才能保证整体抬升前沿。
所属事件:RL 奖励设计:λ_e 相切以抬升 Pareto 前沿(3 条相关)→
「研究」频道最新
- 只学小学课本的 5B 模型:从零训练 LittleLearner 验证语料上限 — repligate · 2026-09-12
- 陶哲轩等菲尔兹奖得主反对 AI 解题的两大理由与反驳 — RexDouglass · 2026-09-12
- Bittensor 悬赏求解悬置 30-80 年数学难题,由 AI 当裁判 — markjeffrey · 2026-09-12
- FADA 入选 CoRL 2026 并开源:人形机器人仅用两分钟经验自适应新环境 — GuanyaShi · 2026-09-12
- Intel 光互连耦合器实测插损 1~1.5 dB,工艺良率瑕疵可见 — jwt0625 · 2026-09-12
- CPO 论文遭质疑:DLW 芯片与 PIC 耦合方式仅以「如 TCB 等」带过 — jwt0625 · 2026-09-12