Meta 论文:用强化学习优化代码执行速度,性能最高提升上倍
facebook · hf · 2026-07-30
Meta 发布了一项关于使用强化学习进行代码优化的研究。虽然目前用 RL 结合隐藏测试用例来保证代码正确性已经很成熟,但将其扩展到代码执行速度的优化却充满挑战:一旦将执行时间作为奖励,测量噪声、奖励稀疏性或 GRPO 不稳定性就会淹没有效信号。
为此,研究团队提出了包含三个阶段的解决方案:
- 构建了带有大型优化测试和校准沙盒的 DMC-Optim 基准。
- 在 RL 环境中组合正确性与速度,并使用离线模拟器预测最有希望的配置。
- 调整 GRPO 和评估机制,以适应更稀疏、更嘈杂的定时执行环境。
在 DMC-Optim 上,这种优化感知配置将 Qwen 2.5 7B 的严格 top-50% pass@1 从 18.0% 提升至 31.3%,将 CWM 32B 从 30.7% 提升至 50.4%。在更严格的评估标准下,提升幅度最高可达 200%,且不损失代码的正确性。
所属事件:Meta 新研究突破代码正确性与执行效率的帕累托前沿(3 条相关)→
「研究」频道最新
- NeurIPS审稿人失踪引热议:如何应对学术Rebuttal被无视 — grumpket · 2026-07-30
- AIPOCH 开源 550+ 医学研究 Agent 技能库 — tom_doerr · 2026-07-30
- ICSE'26 论文提出新范式:抛弃测试框架的 in-vivo 模糊测试 — moarbugs · 2026-07-30
- LMSYS 推出 Miles 训练栈:原生支持 Blackwell 8-bit 与 4-bit RL — BanghuaZ · 2026-07-30
- NeurIPS 2026 研讨会探讨:智能体如何部署后持续学习且不遗忘 — DanielKhashabi · 2026-07-30
- 蒙特利尔AI发布53页论文:构建加速世界的AI预测框架 — Ghost_Pilot_MD · 2026-07-30