SWE-bench 推出多模态评测基准,斯坦福与 Meta 联合开发

jyangballin · x · 2026-09-01

SWE-bench Multimodal 现已通过 SWE-bench 仓库提供,新的多模态数据即将公布,排行榜已开放提交。该项目由斯坦福和 Meta MSL 跨团队完成。作者评论称,尽管 Anthropic 模型在多模态性能上稳步提升,但要达到 90% 的解决率仍需时间。

所属事件:SWE-bench推出多模态版,聚焦前端开发任务(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →