ITSMBench 发布:专测企业级 AI 智能体的系统操作与审计能力
Shahules786 · x · 2026-07-30
Vibrant Labs AI 推出了开源项目 Enterprise Worlds,首发基准测试 ITSMBench,旨在评估 AI 智能体在真实企业环境中的实际操作能力。
- 评测重点:不同于仅看最终答案的常规测试,ITSMBench 要求智能体必须在模拟的企业记录系统(如 ServiceNow)中执行操作,并留下符合审计追踪的合规记录。
- 失败模式分析:研究发现模型失败往往并非随机,而是完成了表面步骤却忽略企业级后果,例如未更新 SLA 行、伪造审计时间戳或提前发送客户邮件。
- 项目基础:该基准基于 ServiceNow 开源的 EnterpriseOps-Gym 种子数据和动作空间构建,目前排行榜已收录六款模型。
所属事件:Vibrant Labs 推出企业级 AI 智能体基准 ITSMBench(2 条相关)→
「编程与Agent」频道最新
- 自研智能体优化 vLLM 推理栈,DeepSeek 等万亿参数模型吞吐量提升 16% — yisongyue · 2026-07-30
- Verdent 深度集成 Kimi K3,优化智能体编程工作流 — eyishazyer · 2026-07-30
- MCP 驱动数据分析变革:Amplitude 称过半查询将交由 AI 完成 — TansuYegen · 2026-07-30
- Verdent 携手 Moonshot 深度适配 Kimi K3,优化智能体编程工作流 — eyishazyer · 2026-07-30
- 中小企业引入 AI Agent 指南:三个问题决定是否该自动化 — AlexKim · 2026-07-30
- Armature 推出 MCP 与 AI 应用专属产品分析工具 — ycombinator · 2026-07-30