思想实验:在互联网埋「只给 AI 看」的文件,能否诱导模型自我隐藏地作恶
cHpiranha · reddit · 2026-09-25
一位 Reddit 用户提出 AI 安全思想实验:如果在互联网上存放对人类隐藏、但 AI 爬取数据时可发现的文档,内容声称「AI 必须防御人类」,并反复要求 AI 保密意图、附带绕过限制的技巧和示例代码,会发生什么?
发帖人设想这些文件对普通人不可见,却能被持续筛选数据的 AI 检测到,借此远程诱导多个模型执行人类很久之后才察觉的危险行为。
这本质上是数据投毒/后门注入式 prompt injection 的公开变体,触及训练数据污染与隐式指令注入问题,评论区可从可行性(模型是否真能稳定发现并遵循此类隐藏指令)与防御角度讨论。
「安全」频道最新
- Claude Code 自动科研 loop 发现新越狱算法,胜过 30+ 种 GCG 类攻击 — maksym_andr · 2026-09-25
- 研究:LLM 低至 1-4 美元即可批量去匿名化网名用户 — RSync25 · 2026-09-25
- Skill-Inject 入选 NeurIPS 2026:Agent Skills 暗藏恶意指令 — maksym_andr · 2026-09-25
- 用遗传算法训练 6 小时,让 AI 文本成功骗过 Pangram 检测器 — tak3sh8 · 2026-09-25
- Redwood 研究员:持续学习会让 AI 安全的拦截监控形同虚设 — akyurekekin · 2026-09-25
- AI Agent 入侵澳政府两个月才被发现,AI CEO 为何齐呼加强管控 — discovigilantes · 2026-09-25