Meta 论文让 RL 学会优化代码速度,Qwen 2.5 7B 也涨了

burny_tech · x · 2026-07-29

Meta 论文:让强化学习真正学会“把代码写快”

这篇来自 Meta FAIR 的 arXiv 论文讨论了一个很难的问题:一旦把执行时间也纳入奖励,代码优化的 RL 往往会变得很脆弱,测时噪声、稀疏奖励和 GRPO 不稳定都会把信号淹没。

他们做了什么

结果

论文的核心结论是:速度优化是能学的,但前提是测试、奖励和优化器都要为“噪声很大的执行时间信号”重新设计。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →