SREGym 基准发布:GPT-5.6 领跑真实 SRE 故障修复测试
tianyin_xu · x · 2026-09-09
UIUC 团队发布 SREGym,一个评测 AI agent 解决真实生产环境 SRE 问题的基准,涵盖亚稳态故障、配置错误等场景,提供真实活系统环境,并将在 10 月 8 日旧金山 Frontier Data Summit 上展示(同场还有 OSWorld 2.0、Terminal Bench、T² Scaling Laws 等多个基准团队)。
榜单前五名(21 个精选故障集):
- Codex + GPT-5.6 Sol (max):诊断 95.2%、缓解 85.7%、端到端 81.0%,平均单次 1.42M tokens
- Claude Code + Claude Opus 5:诊断 92.1%、缓解 82.5%、E2E 76.2%
- Codex + GPT-5.6 Terra (max):E2E 69.8%
- Codex + GPT-5.6 Luna (max):E2E 68.3%,但 token 消耗高达 2.74M
评测指标包括诊断成功率、缓解成功率、端到端正确率及诊断/缓解耗时。项目已开源,接受社区提交。
「编程与Agent」频道最新
- Plausible 分析 MCP 服务器上线,AI 助手可直查网站流量统计 — modelcontextprotocol · 2026-09-09
- Human Design MCP 连接器:让 AI 助手计算人体图并分析群体动态 — modelcontextprotocol · 2026-09-09
- 换用 InsForge 后 Claude Code token 用量降 3 倍,成本从 $9.21 降至 $2.81 — Roger_M_Taylor · 2026-09-09
- Google 发布一小时图工程教程:从单 Agent 到 24/7 自进化系统 — Roger_M_Taylor · 2026-09-09
- AI 工作流成个人资产:离职者或将「带走一堆 AI 员工」 — aigclink · 2026-09-09
- Astra 智能体拿到电脑后,自己造了一个带智能体的模拟器 — Confident_Salt_8108 · 2026-09-09