Meta Paper: Optimizing Code Execution Speed via RL Achieves Up to 200% Improvement

facebook · hf · 2026-07-30

Meta released research on Reinforcement Learning for Code Optimization. While using RL with hidden test cases for code correctness is established, extending it to execution speed is challenging: timing-based rewards are easily overwhelmed by measurement noise, reward sparsity, or GRPO instability.

To solve this, the researchers proposed a three-stage approach:

On DMC-Optim, optimization-aware configurations improved strict top-50% pass@1 from 18.0% to 31.3% for Qwen 2.5 7B, and from 30.7% to 50.4% for CWM 32B. Under stricter criteria, improvements reach up to 200% while preserving pure-correctness scores.

Related event: Meta Research Breaks Pareto Frontier in Code Efficiency via RL(3 posts)→

Original post →

More from Research

Research channel →