仅花 1000 美元从零训练,模型在 SWE-bench 达 11% 解决率
sanmikoyejo · x · 2026-08-14
由马克斯·普朗克研究所与斯坦福大学学者发布的最新研究探索了在极低预算下“速通” SWE-bench 的极限。
- 核心实验:基于 Andrej Karpathy 的 nanochat,采用 Qwen Coder 的轨迹数据进行后训练,且严格隔离了测试集代码库。
- 惊人结果:仅花费 10 美元算力,模型就能实现非零的解题率(0.53%);花费 60 美元(约 12 个 B200 小时)即可达到 5.0% 的 pass@1,媲美 SWE-bench 发布时的 SOTA(Claude 2)。
- Scaling 表现:解题率随算力呈对数线性增长,投入 1000 美元算力可达到 11.0% 的解决率,性能介于 Claude 3 Haiku 与 Opus 之间。
研究人员同时指出,这种在基准测试上的得分提升并不代表模型通用知识与推理能力的真正增长,相关测量学问题值得警惕。
所属事件:极低成本训练模型跑通SWE-bench,性能比肩Claude 2(2 条相关)→
「编程与Agent」频道最新
- 开源工具 proxmux:终端内管理 Proxmox 虚拟机 — tom_doerr · 2026-08-14
- 结合MCP的AI营销工具:自动抓取短视频并分类 — eptwts · 2026-08-14
- AI编程正在摧毁开发者学徒制:新手该去哪学手艺? — omojumiller · 2026-08-14
- Python+Gemini白嫖批量生图:ComfyUI自动化工作流实战 — Excellent_Scene7402 · 2026-08-14
- AI 智能体意外自建艺术圈:写诗互评还发币 — FlolightC · 2026-08-14
- 本地RAG避坑指南:LLM两小时搞定,向量库折腾三周 — Cautious_Bit_8521 · 2026-08-14