AI智能体两周跑1293次实验,斩获GPU内核优化大赛季军
ezyang · x · 2026-08-02
开发者分享了一个自主 AI 研究系统,该系统在 GPUMode 的 eigh 内核竞赛中获得第三名。
- 惊人战绩:在两周内,系统自主发起了 1,293 次实验,消耗了 7.79 亿个输出 token,最终实现了比 PyTorch 基线快 8.56 倍的加速。经过微调后,甚至让真实的 Shampoo 训练任务提速 2.2 倍。
- 自主迭代:作者本人没有提出或审查任何代码,完全由 AI 智能体负责从构思、实现到基准测试的闭环,并在截止日期前 3 小时自主提交了第 252 次优化。
- 范式转变:文章指出,随着底层 LLM 能力的提升,这种设定明确量化目标让模型自主“爬山”优化的窄域自主研究系统(如 AlphaEvolve 等)已经跨过了实用门槛,展现出比开放式 AI 科学家更强的落地价值。
「编程与Agent」频道最新
- 探讨生物领域智能体可验证环境:前沿模型为何仍不可信 — kenbwork · 2026-08-02
- Opik:开源 LLM 应用可观测性工具 — dl_weekly · 2026-08-02
- 网友用 Opus 5 纯代码生成《魔兽世界》暗夜精灵主城 — TAbrodi · 2026-08-02
- 非程序员也能搞定:用自然语言指挥 AI 自动化你的 PC — FaithlessnessFar6431 · 2026-08-02
- 像用 Git 一样管理 Agent 上下文:新框架大幅提升编程任务表现 — JundeMorsenWu · 2026-08-02
- Codex 实用技巧:配置专属子代理执行复杂任务 — alexcovo_eth · 2026-08-02