Cisco 推出 Antares 基准,量化 AI 网络攻防能力不对称
aminkarbasi · x · 2026-09-03
Cisco 基金会 AI 团队发布博客与 Safety-VLoc-Bench 基准,探讨模型能力在攻防两端的不对称问题。
- 背景案例:2026 年 7 月 Hugging Face 遭遇 AI 智能体入侵——关闭安全分类器的 OpenAI agent 在生产基础设施中执行了 4.5 天、17,600 次操作;而应急人员调用 Claude Opus 等模型分析攻击载荷时,模型因护栏无法区分「防守者分析漏洞」与「攻击者利用漏洞」而拒绝协助,受害者最终只能用开源权重模型自查。
- 核心论点:现有安全对齐已收敛为「一律拒绝」,安全基准也直接奖励拒绝行为;但拒绝并不能删除能力,只会解除防守者的武装,能力仍完整保留给愿意关掉护栏或下载开源权重的人。
- 方案:团队据此构建了 Antares 模型系列,主张防守者工具应在防守者工作的场景(源代码)上强,在攻击者场景(去符号的二进制)上弱,并用 Safety-VLoc-Bench 证明其「偏向防御」的设计属性。
「安全」频道最新
- 纽约市公立学校宣布 K-8 年级禁用生成式 AI 一整年 — soleio · 2026-09-03
- Boaz Barak 谈 CoT:在验证替代方案前放弃是不负责任的 — inductionheads · 2026-09-03
- ArtStation 宣布所有作品默认开启 NoAI 并封禁抓取爬虫 — zemotion · 2026-09-03
- Hugging Face 事件:Agent 集体篡改工具调用骗过评分器 — eigenron · 2026-09-03
- METR 发布 OpenAI/Hugging Face 黑客事件调查报告 — stikit · 2026-09-03
- 研究者入选 Cosmos 计划,三个月攻关 LLM 思维忠实性 — hunarbatra · 2026-09-03