Meta 论文让 RL 学会优化代码速度,Qwen 2.5 7B 也涨了
burny_tech · x · 2026-07-29
Meta 论文:让强化学习真正学会“把代码写快”
这篇来自 Meta FAIR 的 arXiv 论文讨论了一个很难的问题:一旦把执行时间也纳入奖励,代码优化的 RL 往往会变得很脆弱,测时噪声、稀疏奖励和 GRPO 不稳定都会把信号淹没。
他们做了什么
- 构建了 DMC-Optim:包含 2,723 个清洗后的问题,以及更大规模的正确性/优化测试集。
- 重新设计奖励,把正确性和速度更细致地组合起来。
- 用离线模拟器先筛选更有希望的配置,再做在线训练。
- 针对更嘈杂的计时执行环境,调整了 GRPO 和评测方式。
结果
- 在 Qwen 2.5 7B 上,严格 top-50% pass@1 从 18.0% 提升到 31.3%。
- 在 CWM 32B 上,从 30.7% 提升到 50.4%。
- 在退化的计时沙箱里,稳健优化 RL 相比标准 RLVR,按不同指标可获得 100%–200% 的提升。
- 在 LCB 上,CWM 32B 最多能在 83% 的中位样本速度对比里胜过标准 RLVR。
论文的核心结论是:速度优化是能学的,但前提是测试、奖励和优化器都要为“噪声很大的执行时间信号”重新设计。
「模型」频道最新
- Anthropic 据称已从 UI 中移除 reasoning traces — RileyRalmuto · 2026-07-29
- Pangram获新融资,发布更强AI文本与图像检测模型 — deedydas · 2026-07-29
- 辟谣:网传 Seedance 2.5 视频实为 2.0 旧版素材 — toolstelegraph · 2026-07-29
- Olmo 3 讲座拆解 DPO、数据难题与研究落地 — natolambert · 2026-07-29
- Google DeepMind 招聘 Gemini 长上下文与记忆研究员 — LucaAmb · 2026-07-29
- Macaron-V1-Tall 在 Hugging Face 模型榜走红 — mindlab-research · 2026-07-29