Cognition 高管称 SWE-bench 已饱和,需自建基准

LangChain · x · 2026-08-07

Cognition AI 的 Russell Kaplan 在播客访谈中指出,当前的 SWE-bench 基准测试已经“完全饱和”,无法有效区分顶尖模型的编码能力,因此 Cognition 决定构建自己的编码评估基准。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →