多力度 RL 训练:用 R = S − λ_e·C 奖励整体抬升 Pareto 前沿
carlesgelada · x · 2026-09-12
Carles Gelada 发起讨论:其团队目标是通过多力度(multi-effort)RL 训练把整条 Pareto 前沿向上推。他们从第一性原理推导出奖励应为 R = S − λe·C,其中 S∈{0,1} 表示 rollout 是否解题成功,C 为 rollout 成本,λe 是按力度变化的成本惩罚系数。后续推文给出了 λe 的具体取值方法。
所属事件:RL 奖励设计:λ_e 相切以抬升 Pareto 前沿(3 条相关)→
「研究」频道最新
- 果蝇大脑连接组交易比特币一天半,收益 4.32% 跑赢机器学习模型 — johnseach · 2026-09-12
- ICLR 2026 论文 MoM:混合多记忆状态破解线性模型召回短板 — kastnerkyle · 2026-09-12
- 哈佛研究员用果蝇大脑连接组交易比特币,1.5 天跑赢 ML 模型 — Scobleizer · 2026-09-12
- 8 个 LLM 与 1.8 万人对比:模型会做难题却常缺失基础知识结构 — rohanpaul_ai · 2026-09-12
- 88 题自改进基准 RSI-Exam 开放 35 题,被看好接棒 SWE-bench — cihangxie · 2026-09-12
- ETH Zurich 等发布 SuperFlex:可变形超二次曲面分解点云,比 Marching Primitives 快万倍 — orlitany · 2026-09-12