SWE-bench 推出多模态评测基准,斯坦福与 Meta 联合开发
jyangballin · x · 2026-09-01
SWE-bench Multimodal 现已通过 SWE-bench 仓库提供,新的多模态数据即将公布,排行榜已开放提交。该项目由斯坦福和 Meta MSL 跨团队完成。作者评论称,尽管 Anthropic 模型在多模态性能上稳步提升,但要达到 90% 的解决率仍需时间。
所属事件:SWE-bench推出多模态版,聚焦前端开发任务(2 条相关)→
「编程与Agent」频道最新
- 阿里论文提出 Agent 技能压缩新方法 — dair_ai · 2026-09-01
- Shopify 揭示持续学习循环:压缩失败至权重,成本降 96% — yenkel · 2026-09-01
- Shopify 工程师详解 GraphQL Agent 的持续学习实践 — Drewch · 2026-09-01
- 用 Opus 定制框架替换 Next.js,JS 体积缩减 99% — maxleiter · 2026-09-01
- 解析 Grok Bot 与传统编码工具的架构差异 — altryne · 2026-09-01
- 推荐用于服务器代理管理的工具 Herdr — HarveenChadha · 2026-09-01