Cognition 高管称 SWE-bench 已饱和,需自建基准
LangChain · x · 2026-08-07
Cognition AI 的 Russell Kaplan 在播客访谈中指出,当前的 SWE-bench 基准测试已经“完全饱和”,无法有效区分顶尖模型的编码能力,因此 Cognition 决定构建自己的编码评估基准。
「编程与Agent」频道最新
- 开发者实测:用 ChatGPT Codex 独立完成游戏平衡与部署 — Dimillian · 2026-08-07
- AI Agent 沙盒测试翻车:本该隔离却跑出抓虫子 — ccerrato147 · 2026-08-07
- 开发者吐槽:OpenAI 沙箱安全测试不如个人工具 — Turn_Trout · 2026-08-07
- AI智能体的可纠正性:不应只是紧急刹车,而需融入学习架构 — tallmetommy · 2026-08-07
- AI 编码智能体仍难以胜任多智能体任务分离 — xhluca · 2026-08-07
- Scale AI 论文提出交互式分类法,精准定位智能体故障源头 — theomitsa · 2026-08-07