新基准 DMC-Optim:让 AI 代码不仅正确而且运行更快

burkov · x · 2026-08-03

当前的代码生成模型往往只关注代码的正确性而忽略了执行效率。直接在强化学习中加入运行时间作为奖励常常失效,因为计时测量存在噪声,且反馈稀疏导致更新不稳定。

为了解决这一问题,来自 Inria、Meta 和巴黎九大的研究人员提出了 DMC-Optim 基准。该基准基于竞赛编程问题构建,使用更严格的正确性检查和更大的输入数据,以有效区分正确代码间的速度差异。结合隔离的运行时测量、仅对正确代码给予速度奖励、低成本超参模拟器以及稳定模型更新的策略,他们显著提升了模型生成高效代码的能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →