三篇论文揭示 LLM 难做代码复杂度优化,RL 训练找到突破口
TimDarcet · x · 2026-09-30
Meta 研究人员 Pierre Chambon、Gabriel Synnaeve 等总结其系列三篇论文,系统研究 LLM 在代码时间/空间复杂度优化上的短板与改进路径:
- BigO(Bench)(arXiv:2503.15242):新基准,含 3,105 道竞赛编程题与约 119 万个解,用 profiling 自动标注时间/空间复杂度标签。评测发现推理模型生成代码强,但对复杂度的理解并不突出,提示其难以泛化到训练时无奖励的任务。
- 第二篇:证明对代码优化做 RL 很难,且能力「嵌入在权重空间」中。
- 第三篇:在难的基础上找到了让 RL 生效的方法。
这一系列工作指出了当前推理模型在算法复杂度控制上的真实短板,并给出了可行的 RL 训练路线。
「研究」频道最新
- 色编码技巧突破:对称布尔函数获 2^O(√n) 深度-3 电路 — rrwilliams · 2026-09-30
- Epoch AI:AI 从奥数到 Navier-Stokes,进展比基准分数显示的更稳 — TWIML AI Podcast · 2026-09-30
- Claude 用 28 个 AND 门实现 AES S-Box,刷新 NIST 电路复杂度纪录 — jedisct1 · 2026-09-30
- Terminal-Bench 观察引出新视角:模型失败未必是能力不行 — abeirami · 2026-09-30
- NVIDIA 开源 Physis-Lang:给视频世界模型补物理课,登顶 Physics-IQ 榜 — NVIDIAAI · 2026-09-30
- 激光照射 Kapton 胶带造出石墨烯,装上 3D 打印机可精确加工 — johnowhitaker · 2026-09-30