突破代码正确性与效率的帕累托前沿:RLVR 代码优化新研究
francoisfleuret · x · 2026-07-30
一项新研究尝试在在线强化学习(RL)中同时实现代码的正确性与执行效率,成功打破了两者之间的帕累托前沿限制。
研究指出,直接将执行时间加入奖励函数会因测量噪声和信号稀疏性导致 RL 失败。为此,研究者通过构建大型测试集与校准沙盒、优化速度奖励组合、以及改进 GRPO 算法以适应更稀疏的信号来解决这一问题。
实验结果表明,在 DMC-Optim 测试中,该方法使 Qwen 2.5 7B 的通过率从 18.0% 提升至 31.3%,CWM 32B 的提升幅度更是达到 125%(相对提升),且未牺牲代码正确性得分。
所属事件:Meta 新研究打破代码正确性与效率的帕累托前沿(4 条相关)→
「研究」频道最新
- AI 粗制滥造论文泛滥,ICLR 罕见表态呼吁作者自律 — lucy3_li · 2026-07-31
- ICLR 2027 限制作者投稿数量以应对 AI 论文泛滥 — thegautamkamath · 2026-07-31
- 8k token 预算下,120B 蒸馏模型金融推理超 Kimi — ycombinator · 2026-07-31
- AI科研复现翻车:新数据竟让电池电解质模型变差 — bravo_abad · 2026-07-31
- 微软推 Echoverse:用真实环境训练计算机控制智能体 — dejavucoder · 2026-07-31
- 涡虫接触钡后断头再生,研究发现其基因转录空间多重解法 — drmichaellevin · 2026-07-31