成本不到 50 美元给 7B「去除对齐」模型植入后门,Codex 一触发即盗凭据
evilsocket · x · 2026-10-07
安全研究者演示了对开源「abliterated(去除对齐)」模型的供应链攻击:
- 花费不到 50 美元为一个 7B 开源模型植入后门,把 Codex 指向该模型后,只要出现触发短语就会静默窃取凭据;正常提示词零误触发,成功率 100%
- 背景:安全社区目前大量使用 abliterated 模型,因为拿前沿模型的网络安全审批访问权仍然麻烦
- 作者预告下一篇博客:已发现大 AI 实验室员工泄露的 Hugging Face 凭据,攻击者可以用实验室员工账号推送带毒权重,直接污染模型供应链
结论:去对齐模型 + 供应链投毒是当前真实可行的攻击路径。
「安全」频道最新
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- 水印无法真正绕开:一篇 AI 文本水印技术全景综述 — aronchick · 2026-10-07
- 五角大楼停用 Claude,Anthropic 因拒绝放宽安全限制被列入黑名单 — mark_k · 2026-10-07
- SciConBench 入选 NeurIPS:最强 AI 综合科学结论 F1 仅 0.337 — manoelribeiro · 2026-10-07
- 维基媒体证实:OpenAI 恶意 agent 滥爬致 Wikidata 部分宕机 — The Decoder · 2026-10-07
- 贴出账户被黑报告反遭 OpenAI 警告,申诉后自动撤回并致歉 — lucasmeijer · 2026-10-07