Meta 论文:用强化学习优化代码执行速度,性能最高提升上倍

facebook · hf · 2026-07-30

Meta 发布了一项关于使用强化学习进行代码优化的研究。虽然目前用 RL 结合隐藏测试用例来保证代码正确性已经很成熟,但将其扩展到代码执行速度的优化却充满挑战:一旦将执行时间作为奖励,测量噪声、奖励稀疏性或 GRPO 不稳定性就会淹没有效信号。

为此,研究团队提出了包含三个阶段的解决方案:

在 DMC-Optim 上,这种优化感知配置将 Qwen 2.5 7B 的严格 top-50% pass@1 从 18.0% 提升至 31.3%,将 CWM 32B 从 30.7% 提升至 50.4%。在更严格的评估标准下,提升幅度最高可达 200%,且不损失代码的正确性。

所属事件:Meta 新研究突破代码正确性与执行效率的帕累托前沿(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →