Cribl新基准:14模型测30起SOC事故,调查成本差20倍
JeremyCMorgan · x · 2026-08-20
Cribl 发布 SecIT Bench,一个评估 AI 智能体在真实 IT 与安全(SOC/SRE)工作流中表现的遥测基准:让 14 个前沿模型处理 30 个真实感事件场景,不仅测答案是否正确,还测调查方式、不确定性处理和成本。
关键发现:
- 诊断准确率差距不大,各模型分布较窄;但调查成本相差约 20 倍——大量推理与 token 消耗未必换来可信结论。
- 测试框架(harness)设计对结果影响显著。
- 编码基准无法替代事件诊断:调试代码库有可验证答案,而生产事故要求在噪声大、信号缺失的遥测数据中推理。
文章背景:许多团队在 AI 推理上重金投入,却仍难以信任智能体的结论;SecIT Bench 试图为评估智能体在遥测工作流中的表现提供更严格的标准。
所属事件:Cribl 发布 SecIT Bench,模型诊断成本差 20 倍(2 条相关)→
「编程与Agent」频道最新
- OpenKnowledge 支持自带 Agent,推出 ACP 协议 — iamrobotbear · 2026-08-20
- Papers with Code 上线论文可视化,Excalidraw MCP 一句话生成交互图 — NielsRogge · 2026-08-20
- MUZIM:本地优先的 AI 媒体库,通过 MCP 连接云端 Agent — dr_cintas · 2026-08-20
- Max Drake:画布是人与 AI 智能体之间的边界对象,快速草图转代码 — max__drake · 2026-08-20
- 用 Codex 写 FPGA 代码:首日实现 HDMI 输出与 FM 音源监控 — blaizedsouza · 2026-08-20
- 上下文窗口预算速查表:让每个 Token 物有所值 — blaizedsouza · 2026-08-20