阿里推首个攻破后应急响应基准,23个前沿大模型无一通关
Alibaba-NLP · hf · 2026-07-30
阿里巴巴团队推出名为 SecRespond 的新基准测试,专门用于评估 LLM 智能体在真实世界“攻破后”安全事件中的应急响应能力。
现有安全评测多聚焦于攻击发生前的理想环境,而该基准要求智能体基于被入侵主机的磁盘快照、警报和漏洞扫描结果,生成取证报告并制定补救计划。
- 测试范围:覆盖 10 个不同云主机网络靶场,包含 4 种入口点、21 项 ATT&CK 技术和 5 种操作系统。
- 评测结果:对 23 个前沿大模型的测试表明,尽管模型能根据警报发现问题,但在主动排查“静默入侵”和生成全面补救计划方面困难重重。
- 核心结论:没有任何一个模型能在任何单一场景下实现完全的检测与修复,这揭示了当前构建实战安全智能体的根本瓶颈。
「安全」频道最新
- AI 文本检测工具被指无效:专家批其源于对生成文本的偏见 — l4rz · 2026-07-30
- AI监督AI存在串通风险,研究者呼吁引入形式化验证 — FinanceYF5 · 2026-07-30
- CloudRip:绕过Cloudflare寻找真实IP的开源工具 — tom_doerr · 2026-07-30
- JFrog安全团队揭露SQLite虚假CVE漏洞 — cyb3rops · 2026-07-30
- CivitAI 大规模下架成人及面部 LoRA,老用户震惊 — literally-me-bro · 2026-07-30
- Ilya Sutskever 签署《Pacing the Frontier》AI 安全倡议 — basedjensen · 2026-07-30