Meta 论文揭示强化学习优化代码的陷阱与解法
rohanpaul_ai · x · 2026-08-01
Meta 的新论文指出,将强化学习直接用于代码优化通常会失败,因为运行时间是一个稀疏且充满噪声的信号,简单粗暴的奖励机制往往会损害代码的正确性。
作者提出必须协同重新设计整个反馈链路:
- 基础设施:扩大测试规模,使用校准过的远程执行服务来获取准确时间。
- 奖励机制:引入基于人类解决方案的相对排名,并采用以正确性为门槛的二元奖励。
- GRPO 算法改进:通过增加每个提示的采样数、扩大批次、移除组方差归一化以及丢弃过时的时间数据,来稳定零优势批次下的训练。
在完整重建这套流程后,Qwen 2.5 7B 模型在 top-50% 速度阈值下的表现从 18.0% 显著提升至 31.3%。
「研究」频道最新
- 研究者称上下文MoE可廉价转为纯查找模型,寻求算力资助 — breath_mirror · 2026-08-01
- Andriy Burkov 新书《百页大语言模型书》限时折扣至 20 美元 — burkov · 2026-08-01
- 绘制人类大脑血管空间图谱:超百万细胞数据揭示疾病风险 — anshulkundaje · 2026-08-01
- AprilCube:支持 3D 打印的 6-DOF 基准标记检测开源项目 — rsasaki0109 · 2026-08-01
- benign训练致模型「自我越狱」,安全对齐面临新挑战 — AaronBergman18 · 2026-08-01
- 李飞飞 WorldLabs 收购 SceniX,世界模型从生成走向物理模拟 — 量子位 · 2026-08-01