SWE-Bench ProMax:补齐大规模重构的 AI 评测

rseroter · x · 2026-08-25

现有大多数 AI 编程 Agent 基准测试跳过了大规模重构场景,而新的 SWE-Bench ProMax 基准填补了这一空白。文章探讨了这是否是测试前沿模型对大型代码库深度理解能力的好方法。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →