Meta 论文揭示强化学习优化代码的陷阱与解法

rohanpaul_ai · x · 2026-08-01

Meta 的新论文指出,将强化学习直接用于代码优化通常会失败,因为运行时间是一个稀疏且充满噪声的信号,简单粗暴的奖励机制往往会损害代码的正确性。

作者提出必须协同重新设计整个反馈链路:

在完整重建这套流程后,Qwen 2.5 7B 模型在 top-50% 速度阈值下的表现从 18.0% 显著提升至 31.3%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →