$1000 算力从零训出 nanoswe,SWE-bench 达 15.7% 追平 Claude 3 Opus
sanmikoyejo · x · 2026-10-03
社区项目 nanoswe 发布新纪录:在 SWE-bench Verified 上从 11.8% 提升至 15.7%,追平 Claude 3 Opus(15.8%),全部训练成本约 $1000(192 B200 小时),从零训练。这是一个「用 $1000 买到最好 agent」的社区 speedrun 竞赛。
- $60 赛道(12 B200 小时):nanochat + 长上下文 + qwen coder 轨迹,5.0%
- $1000 赛道(192 B200 小时):叠加 nemotron lightning 轨迹后达 15.7%;此前 vLLM serving 修复版为 11.8%,基础版 11.0%
- 待超越对象:GPT-4o 23.2%,Claude 3.5 Sonnet 33.6%
- 权重、评测结果、训练脚本全部开源,任何人可提交改进运行
「编程与Agent」频道最新
- Every 撰文:每家企业都将拥有自己的 Agent,如同当年人人建网站 — every · 2026-10-03
- AI Conference Day 2:Agent推理成本与监控成全场焦点 — sanjaykalra · 2026-10-03
- 开源 28 个可移植 Agent Skills,给编码智能体装上思维模型 — tom_doerr · 2026-10-03
- ChatGPT 订阅额度打通 11 家合作应用,Plus/Pro 可直接登录使用 — _AustinCalvert_ · 2026-10-03
- Agent 时代如何选技术栈:训练数据量决定一切 — aiblastoff · 2026-10-03
- 审计数十家企业后总结:AI 工作流上线失败的四大原因 — salespire · 2026-10-03