Cribl 发布 SecIT Bench:14 模型诊断成本差距达 20 倍

jonathan_wilke · x · 2026-08-20

Cribl 发布了 SecIT Bench,这是一个针对 IT 和安全工作流中 AI Agent 的评估基准。测试让 14 个前沿模型处理 30 个真实事故场景,结果发现尽管诊断准确率差异不大,但调查成本相差高达 20 倍。该基准旨在解决当前缺乏评估 AI 推理能力、实际表现及成本控制标准的问题。

所属事件:Cribl 发布 SecIT Bench,模型诊断成本差 20 倍(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →