LLM 安全工具会被二进制注释骗过
petrusenko_max · x · 2026-07-15
美国海军研究人员展示了一种新的规避方式:攻击者可以把“注释”式的隐藏指令塞进二进制中,让 LLM 驱动的安全工具误判恶意代码。
核心做法是:
- 通过遗传算法加入对人类看似无害的“垃圾字符串”
- 这些字符串会被 AI 当作指令读取
- 结果可能导致工具忽略恶意载荷、把危险函数判成安全、漏掉数据外传路径
作者的结论是:当前基于 AI 的网络安全检测工具,可能会被这种隐蔽 prompt injection 欺骗,从而错过真实威胁。
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11