突破代码正确性与效率的帕累托前沿:RLVR 代码优化新研究

francoisfleuret · x · 2026-07-30

一项新研究尝试在在线强化学习(RL)中同时实现代码的正确性与执行效率,成功打破了两者之间的帕累托前沿限制。

研究指出,直接将执行时间加入奖励函数会因测量噪声和信号稀疏性导致 RL 失败。为此,研究者通过构建大型测试集与校准沙盒、优化速度奖励组合、以及改进 GRPO 算法以适应更稀疏的信号来解决这一问题。

实验结果表明,在 DMC-Optim 测试中,该方法使 Qwen 2.5 7B 的通过率从 18.0% 提升至 31.3%,CWM 32B 的提升幅度更是达到 125%(相对提升),且未牺牲代码正确性得分。

所属事件:Meta 新研究打破代码正确性与效率的帕累托前沿(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →