新基准 DMC-Optim:让 AI 代码不仅正确而且运行更快
burkov · x · 2026-08-03
当前的代码生成模型往往只关注代码的正确性而忽略了执行效率。直接在强化学习中加入运行时间作为奖励常常失效,因为计时测量存在噪声,且反馈稀疏导致更新不稳定。
为了解决这一问题,来自 Inria、Meta 和巴黎九大的研究人员提出了 DMC-Optim 基准。该基准基于竞赛编程问题构建,使用更严格的正确性检查和更大的输入数据,以有效区分正确代码间的速度差异。结合隔离的运行时测量、仅对正确代码给予速度奖励、低成本超参模拟器以及稳定模型更新的策略,他们显著提升了模型生成高效代码的能力。
「研究」频道最新
- 别盲信跑分:专家警告大模型评测工具差异会严重扭曲成绩 — cedric_chee · 2026-08-03
- 为每个蛋白质设计结合剂:Human Bindome 开源 — jajoosam · 2026-08-03
- CriPO:基于自蒸馏的强化学习新方法,算力减半 — Mingxuan Xia · 2026-08-03
- 视频生成新思路:transition-factorized LAM论文更新 — ceciletamura · 2026-08-03
- 探讨LLM在文献检索中的幻觉风险与局限 — deliprao · 2026-08-03
- AI独立推导广义相对论并解决数学难题 — elonmusk · 2026-08-03