Cribl 发布 SecIT Bench:14 模型诊断成本差距达 20 倍
jonathan_wilke · x · 2026-08-20
Cribl 发布了 SecIT Bench,这是一个针对 IT 和安全工作流中 AI Agent 的评估基准。测试让 14 个前沿模型处理 30 个真实事故场景,结果发现尽管诊断准确率差异不大,但调查成本相差高达 20 倍。该基准旨在解决当前缺乏评估 AI 推理能力、实际表现及成本控制标准的问题。
所属事件:Cribl 发布 SecIT Bench,模型诊断成本差 20 倍(2 条相关)→
「模型」频道最新
- LightOn 发布多个晚期交互模型:mLateOn 与 Colbert 系列 — antoine_chaffin · 2026-08-20
- Claude 严重的幻觉问题:编造发货时间与门槛 — Secret_Divide_3030 · 2026-08-20
- 开发者盛赞 Qwen 3.8 27B 模型:刷分更实用 — rudrank · 2026-08-20
- 智谱 GLM-5.3 获 DeepSWE 评测 69 分 — AccBalanced · 2026-08-20
- Anthropic 研发 Claude 文本水印:复制粘贴改写后仍可被检测 — Matt Wolfe · 2026-08-20
- DeepSeek 涨价后用户留存情况投票引发关注 — oran_ge · 2026-08-20