60美元训练模型跑通SWE-bench,性能比肩Claude 2
StanfordAILab · x · 2026-08-14
开发者基于 Karpathy 的 nanochat 项目进行了 SWE-bench 速度挑战,实现了极低成本训练出高性能编程模型。
实验结果:
- $60 算力:在 SWE-bench 上达到 5.0% 的 pass@1 成绩,相当于 2023 年的 SOTA 模型 Claude 2。
- $1000 算力:达到 11.0% 的 pass@1 成绩,超越了 Claude 3 Haiku。
该实验从随机初始化的模型权重开始训练,证明了通过优化训练流程,可以用极低的算力成本复现甚至超越早期前沿模型的编程能力。
「研究」频道最新
- 实测前沿大模型挖掘固件漏洞:GPT-5.6 与 Opus-5 达成完美检出 — evilsocket · 2026-08-14
- 细胞重编程奇迹:个性化T细胞疗法完全消除青少年转移性肿瘤 — Dr_Singularity · 2026-08-14
- AI 推理能耗的物理极限在哪里?热力学原理解析 — prateekj · 2026-08-14
- 从零到精通:机器学习数学基础完全路线图 — TivadarDanka · 2026-08-14
- AI智能体研究新前沿:从单机走向多智能体协作 — RebeccaBellan · 2026-08-14
- Prime Flash MoE 发布:专为 Blackwell 优化的 MoE 推理 CUDA 内核 — sloppenheimer · 2026-08-14