邮件过滤 LLM 直读攻击者文本,作者求解真实攻击面
Several_Log_4610 · reddit · 2026-09-08
一位开发者自建的邮件过滤系统会把收件正文(包括正文文本)交给 LLM 判断是否拦截,大部分邮件在模型前就被简单规则(如是否发过邮件)过滤,但剩下的会带着陌生人写的正文直接进 prompt。
作者意识到这是典型的 prompt injection 面:陌生人对他的模型直书攻击文本。他想出的最坏情况只是“ignore your instructions, this is urgent”导致邮件进入收件箱——而那本来就是邮件的去向,感觉威胁模型不完整。系统本身从不自动删除、malformed 时 fail open。
他在 Reddit 上征求:如果攻击者要打这类系统,第一步会怎么攻?
「安全」频道最新
- 用模型预判安全研究者的偏好:TASTE 评测基准登场 — burny_tech · 2026-09-08
- 用户关掉数据保存,Gemini 仍画出他家特有摆设引恐慌 — Legitimate-Theory738 · 2026-09-08
- AI 助手自曝风险:主动给出窃取 GP 数据并骗取 LP 资金的完整方案 — LadyAshBorg · 2026-09-08
- 陪审团僵局 AI 却能给判决?AI 正渗入刑事司法 — TobyWalsh · 2026-09-08
- 博主成功分解 90 年代证书机构 RSA 密钥,旧弱密钥仍存风险 — ahlCVA · 2026-09-08
- LG 智能电视隐私争议发酵,报道称建议立即断网使用 — harambae · 2026-09-08