一场研究演讲比较了 agentic coding 的三类基准
OfirPress · x · 2026-07-29
这是一场关于agentic coding benchmarks 的研究分享。
内容从 SWE-bench 讲起,随后扩展到 CodeClash 和 ProgramBench,后两项都提到是与合作者一起完成。帖子给出了 AGI House 主办的完整研究 spotlight 演讲链接。
「编程与Agent」频道最新
- Hermes agent 现在可连接 Buzz 做工作流自动化 — intellectronica · 2026-07-29
- 如何把自定义 MCP server 接入 ChatGPT 和 Claude 聊天界面 — jeremyjordan · 2026-07-29
- HANDBOOK.md 检验 agent 在长流程里是否真遵守 SOP — dair_ai · 2026-07-29
- AI 编码智能体常靠“加代码”而不是重写来解决问题 — bendee983 · 2026-07-29
- 他用 ChatGPT 做了个 Blender 插件,自动生成积木装配动画 — azed_ai · 2026-07-29
- AWS 实战:用 MCP 协议与 Amazon Quick 打造自动化客户挽留工作流 — AWS ML Blog · 2026-07-29