全新企业级智能体基准ITSMBench开源,直击落地痛点
Shahules786 · x · 2026-08-04
Vibrant Labs 团队开源了 ITSMBench 及其执行轨迹,这是一个用于评估企业级智能体的可执行环境套件。现有的智能体基准通常只测试模型能否给出正确答案,而该基准进一步衡量了智能体在真实组织系统中的实际操作能力。它要求智能体必须在系统记录中执行操作、具备相应权限,并留下经得起审计的轨迹。作者在测试中发现,当前模型在处理这些带有实际业务约束的任务时表现并不理想,并呼吁社区共同参与改进。
「编程与Agent」频道最新
- 长上下文 prefill 挑战跑到 5200+ tok/s — gajesh · 2026-08-04
- Hermes Agent 已接入 ChatGPT、Grok 和 Nous Portal — alexcovo_eth · 2026-08-04
- 一个研究型技能把整条 YouTube 频道导入知识库并自动核查 — gerardsans · 2026-08-04
- NVIDIA 在 NeMo Gym 中加入 Legal Agent Bench,含 1,749 个任务与办公文件技能 — NVIDIAAI · 2026-08-04
- Opus 重构 ML 代码后埋下隐蔽 bug,训练还能跑完 — alex_peys · 2026-08-04
- GitHub 的 stacked PRs 让开发效率大幅提升 — shuding · 2026-08-04