邮件过滤 LLM 直读攻击者文本,作者求解真实攻击面

Several_Log_4610 · reddit · 2026-09-08

一位开发者自建的邮件过滤系统会把收件正文(包括正文文本)交给 LLM 判断是否拦截,大部分邮件在模型前就被简单规则(如是否发过邮件)过滤,但剩下的会带着陌生人写的正文直接进 prompt。

作者意识到这是典型的 prompt injection 面:陌生人对他的模型直书攻击文本。他想出的最坏情况只是“ignore your instructions, this is urgent”导致邮件进入收件箱——而那本来就是邮件的去向,感觉威胁模型不完整。系统本身从不自动删除、malformed 时 fail open。

他在 Reddit 上征求:如果攻击者要打这类系统,第一步会怎么攻?

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →