SWE-bench Multimodal v2.0 Launches Open-Source with 480 Visual Coding Tasks
斯坦福与 Meta MSL 跨团队合作的 SWE-bench Multimodal v2.0 正式发布,包含 480 个新任务,要求编码智能体不仅能处理代码,还需解释截图、图表、录音等视觉资产来诊断和修复仓库中的 bug。该基准已通过 SWE-bench 仓库提供,排行榜开放提交。这是测试 AI 视觉理解与编程结合能力的重要进展。
已确认
- v2.0 共包含 480 个视觉编程任务,已通过 SWE-bench 仓库提供,排行榜开放提交
- v1 为闭源,导致社区采用率低;v2 改为开源,并清理了数据,移除损坏任务和 flaky 测试
- 项目由斯坦福与 Meta MSL 跨团队合作完成
- @OfifPress 指出,与 Verified 和 Multilingua 版本不同,该版本重点强调前端开发任务,大多数任务都需要视觉能力
为什么重要
- @OfirPress 认为它是目前最具挑战性的 SWE-bench 变体,把视觉能力纳入编程评测维度
- @jyangballin 观察到 Anthropic 模型在多模态性能上稳步提升,说明前沿模型在该类任务上仍有明显改进空间
- 开源发布有望提升社区采用率,为多模态编码智能体提供更可靠的横向比较基准
2026-09-01 ~ 2026-09-01 · 5 related posts
Primary sources
- SWE-bench Multimodal v2 Released: 480 Visual Coding Tasks — jyangballin · 2026-09-01
- [source] SWE-bench Multimodal Released by Stanford and Meta, Leaderboard Open — jyangballin · 2026-09-01
- [source] SWE-bench Multimodal variant focuses on front-end development with vision tasks — OfirPress · 2026-09-01
2 near-duplicate retellings: jyangballin · xeophon