UIUC 发布 SREGym:GPT-5.6 Sol 领跑,SRE Agent 端到端解决率仅 81%

tianyin_xu · x · 2026-09-11

伊利诺伊大学香槟分校(UIUC)团队在 Snorkel AI 的 Frontier Data Summit(10 月 8 日,旧金山)上介绍 SREGym——一个用真实生产环境考验 AI Agent 运维能力的 benchmark,涵盖亚稳态故障、错误配置等真实 SRE 问题,并提供可复现的活体系统环境,社区可通过 GitHub 提交评测。

其 SREGym-Lite 21 类故障子集上的榜单:

结论性观察:最强 Agent 端到端(诊断+缓解都对)也只到 81%,且更快更准的组合 token 开销差异近一倍,说明真实生产故障对 Agent 仍是硬门槛。项目还提供 SREGym-Lite 结果页与数据集注册表,方便在标准第三方 benchmark 上评测自家 Agent。

所属事件:UIUC 发布 SREGym 基准,GPT-5.6 领跑(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →