UIUC 发布 SREGym:GPT-5.6 Sol 领跑,SRE Agent 端到端解决率仅 81%
tianyin_xu · x · 2026-09-11
伊利诺伊大学香槟分校(UIUC)团队在 Snorkel AI 的 Frontier Data Summit(10 月 8 日,旧金山)上介绍 SREGym——一个用真实生产环境考验 AI Agent 运维能力的 benchmark,涵盖亚稳态故障、错误配置等真实 SRE 问题,并提供可复现的活体系统环境,社区可通过 GitHub 提交评测。
其 SREGym-Lite 21 类故障子集上的榜单:
- 第 1 名:Codex + GPT-5.6 Sol (max),诊断 95.2%、缓解 85.7%、端到端 81.0%,TTD 211s、TTM 397s,平均 1.42M tokens
- 第 2 名:Claude Code + Claude Opus 5,E2E 76.2%
- 第 3 名:Codex + GPT-5.6 Terra (max),E2E 69.8%
- 第 4 名:Codex + GPT-5.6 Luna (max),E2E 68.3%,但 token 消耗高达 2.74M
- 第 5 名:GPT-5.6 Sol (medium),E2E 58.7%,token 用量仅 0.77M
结论性观察:最强 Agent 端到端(诊断+缓解都对)也只到 81%,且更快更准的组合 token 开销差异近一倍,说明真实生产故障对 Agent 仍是硬门槛。项目还提供 SREGym-Lite 结果页与数据集注册表,方便在标准第三方 benchmark 上评测自家 Agent。
所属事件:UIUC 发布 SREGym 基准,GPT-5.6 领跑(2 条相关)→
「编程与Agent」频道最新
- Muse 浏览器视图禁粘贴,agent 登录体验遭用户吐槽 — altryne · 2026-09-11
- Greg Isenberg:GPT-6 Astra 将引爆小硬件与实体产品创业 — Rasmic · 2026-09-11
- 开发者压测 atelier 套娃嵌套运行,宣称性能尚可 — lucasmeijer · 2026-09-11
- Redis 之父 antirez 亲手为 ds4 编辑器适配 DeepSeek V4.1 — backyard_tractorbeam · 2026-09-11
- 开发者评 Agents API:难点不是模型,而是让 AI 连续工作数小时 — shaunralston · 2026-09-11
- 用 MacBook 翻盖角度传感器做折叠着色器,作者开源应用 — jh3yy · 2026-09-11