Meta 新研究突破代码正确性与执行效率的帕累托前沿

Meta FAIR 发布了一项关于使用强化学习优化代码的新研究,成功打破了代码正确性与执行效率之间的帕累托前沿限制。研究指出,直接将执行时间加入奖励函数会因测量噪声导致训练不稳定。通过新方法,模型不仅保证了代码正确性,还真正学会了优化执行速度,使 Qwen 2.5 7B 等模型的性能获得显著提升。

2026-07-29 ~ 2026-07-30 · 3 条相关