Cribl新基准:14模型测30起SOC事故,调查成本差20倍

JeremyCMorgan · x · 2026-08-20

Cribl 发布 SecIT Bench,一个评估 AI 智能体在真实 IT 与安全(SOC/SRE)工作流中表现的遥测基准:让 14 个前沿模型处理 30 个真实感事件场景,不仅测答案是否正确,还测调查方式、不确定性处理和成本。

关键发现:

文章背景:许多团队在 AI 推理上重金投入,却仍难以信任智能体的结论;SecIT Bench 试图为评估智能体在遥测工作流中的表现提供更严格的标准。

所属事件:Cribl 发布 SecIT Bench,模型诊断成本差 20 倍(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →