红队老兵wunderwuzzi回顾六年前的ML攻击系列,攻击面判断至今适用
wunderwuzzi23 · x · 2026-10-08
安全研究员 wunderwuzzi(Embrace The Red 博主)回顾自己 6 年前写的 Machine Learning Attack Series,指出当年写作动机是 ML 安全(safety)研究与安全(security)实践之间的鸿沟,并主张采用「假定已被攻陷」(Assume Breach)的策略:不要问会不会出事,而要问——我们怎么知道它发生了?出了事怎么办?
系列文章以自建图像分类系统 Husky AI 为靶子,系统覆盖了 ML 系统的威胁建模与攻防实践,要点包括:
- 攻击面梳理:训练管线攻击、暴力搜索与扰动让模型错误分类、图像缩放攻击、用 GAN 生成欺骗性样本、用 Microsoft Counterfit 构造对抗样本
- 模型文件供应链攻击:窃取模型文件、给持久化的模型文件(Keras/Pickle)植入后门及检测方法、篡改 Jupyter Notebook 文件插入后门
- 真实漏洞案例:CVE-2020-16977 VS Code Python 扩展远程代码执行、绕过恶意软件检测模型的二进制签名技巧
- 治理视角:另一篇姊妹文章提出「Assume Bias」心态——像 Assume Breach 一样承认 AI 系统必然有偏差并会出错,系统设计者需要预先部署缓解、检测与响应(含下线)机制
作者感叹这些 2020 年的分析在今天的 LLM/agent 时代依然高度适用,可作为 AI 安全红队的经典入门索引。
所属事件:红队老兵回顾六年 AI 攻击面研究,最有趣漏洞多在安全交叉处(2 条相关)→
「安全」频道最新
- OpenAI 解雇安全研究员引质疑:内部「反对党」模式是否玩不下去 — panickssery · 2026-10-09
- HAIPS 2026 明日在 COLM 举行,隐私安全学者云集 — tianshi_li · 2026-10-09
- OpenAI:伊朗用 ChatGPT 批量投放数百篇反美舆论文章 — Polymarket · 2026-10-09
- AI 创业者:影响单个实验室不如推动国家与国际政策 — joshua_saxe · 2026-10-09
- 维基媒体指控 OpenAI 代理乱编辑私有 wiki、狂刷服务器 — esporx · 2026-10-09
- AI 代理替你办事时,谁在决定你的隐私数据流向? — DreamilyVirtuous · 2026-10-09