企业运维智能体新榜单
hugo_larochelle · x · 2026-07-14
Artificial Analysis 联合 ServiceNow 发布了 EnterpriseOps-Gym-AA,这是基于原始 EnterpriseOps-Gym 改造的独立榜单,用来测试 AI agents 是否能在真实企业系统中完成多步、状态化的运营任务,同时遵守业务规则和政策。
这个评测通过 Stirrup agent harness 运行,覆盖 8 个业务领域,评分不是看中间步骤,而是看任务结束后底层数据库的最终状态。当前榜单中,Anthropic 的 Claude Fable 5(max)以 51% 领先,Google 的 Gemini 3.5 Flash(high)为 50%,OpenAI 的 GPT-5.5(xhigh)为 47%,而 Z.ai 的 GLM-5.2(max)是开源权重模型里分数最高的,达到 43%。
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11