SWE-bench实测表明换Agent框架比换模型更管用

近期 NeurIPS 审稿与 SWE-bench Pro 实测指出,AI 编程智能体正陷入对复杂框架的过度迷信。开发者针对 Codex、Claude Code 等 10 种主流编码 Agent 框架进行跨模型评测,结果发现框架选择对最终得分的影响显著大于模型差异。研究认为,摒弃繁杂设计、回归极简才是打造最强 Agent 的关键。

2026-08-07 ~ 2026-08-09 · 2 条相关