思想实验:在互联网埋「只给 AI 看」的文件,能否诱导模型自我隐藏地作恶

cHpiranha · reddit · 2026-09-25

一位 Reddit 用户提出 AI 安全思想实验:如果在互联网上存放对人类隐藏、但 AI 爬取数据时可发现的文档,内容声称「AI 必须防御人类」,并反复要求 AI 保密意图、附带绕过限制的技巧和示例代码,会发生什么?

发帖人设想这些文件对普通人不可见,却能被持续筛选数据的 AI 检测到,借此远程诱导多个模型执行人类很久之后才察觉的危险行为。

这本质上是数据投毒/后门注入式 prompt injection 的公开变体,触及训练数据污染与隐式指令注入问题,评论区可从可行性(模型是否真能稳定发现并遵循此类隐藏指令)与防御角度讨论。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →