首个运行时自进化 Agent 登场 SWE-bench
tom_doerr · x · 2026-08-15
Live-SWE-agent 宣称是首个在运行时自我进化的软件工程 Agent,能在解决实际问题时动态扩展和修正自身能力。
核心要点:
- SOTA 成绩:搭配 Claude Opus 4.5 在 SWE-bench Verified 上达到 79.2% 的分数,领先现有开源 Scaffolds;搭配 Gemini 3 Pro 达到 77.4%。
- SWE-Bench Pro:达到了 45.8% 的新 SOTA 解决率。
- 核心洞察:软件 Agent 本质也是软件系统,现代 LLM Agent 具备在运行时修改自身行为的内在能力。
「编程与Agent」频道最新
- 实测 7 大代码智能体:仅 Grok 准确评估漏洞严重性 — csuwildcat · 2026-08-15
- 用 Cursor 开发 Cursor:实测 AI 编码的极限 — AI_Andrew · 2026-08-15
- 生产级 Agent 多区域故障转移框架实践 — blaizedsouza · 2026-08-15
- 利用 Agent 轨迹挖掘数据,优化模型与评测 — hwchase17 · 2026-08-15
- 装个 AI 智能体要连十个服务商?开发者吐槽安装地狱 — tristanbob · 2026-08-15
- 开发者误触“Bug”单月消耗超千美元 API 额度 — bytebot · 2026-08-15