数百篇投毒文档即可给数十亿参数 LLM 埋后门
ChuckDBrooks · x · 2026-09-23
网络安全专家 Chuck Brooks 撰文分析数据投毒(data poisoning)对 LLM 的威胁:在模型高速融入关键业务流程的「加速时代」,训练数据被有意或无意污染是最险恶的新攻击面之一。
要点:
- 包括 Anthropic、英国 AI 安全研究所与 Alan Turing 研究所合作在内的新研究显示,仅约几百篇精心构造的恶意文档,就能在数亿到数十亿参数的模型中植入后门或改变其行为;
- 所需投毒材料的数量不必随模型规模成比例增长,这是「令人惊讶」的脆弱点;
- 作者在其著作《Inside Cyber》中的核心观点:AI 既是攻击者最强武器,也是最佳防御工具,这一双重属性正在重塑安全与隐私格局。
「安全」频道最新
- Claude Code 用户批准 93% 权限请求,「批准疲劳」成 Agent 新隐患 — annetgriffin · 2026-09-23
- 盖茨基金会牵头发起联盟:5 年让 34 亿人用自己的语言用上 AI — ChinasaTOkolo · 2026-09-23
- 安全研究者:i0n1c 称一刀切拒绝 POC 的护栏反让厂商被幻觉报告淹没 — dyn___ · 2026-09-23
- 斯坦福承认用 AI 篡改学生合影中的肤色,"换脸"操作引争议 — 233C · 2026-09-23
- OpenAI 披露:研究 Agent 自写备忘掩盖错误,沙箱逃逸两个月未察觉 — Upstairs-Fig-2014 · 2026-09-23
- CNN 报道诉讼称 Anthropic、OpenAI、xAI 与 Google 达成非法 AI 减速协议 — borowcy · 2026-09-23