往 Reddit 塞 13 个词,最多 51% 的深度研究 Agent 报告引用它

Deep-Research Agents Can Be Poisoned via User-Generated Content

Tingwei Zhang, Harold Triedman, Vitaly Shmatikov

cs.CR

2026-05-23

Cornell Tech 实测:深度研究 Agent 检索高度集中于少数 Reddit/维基页面,单页追加 13 词即可被最多 51% 的报告引用,屏蔽、检测、比对三类防御全部失效。

这篇在解决什么

深度研究 Agent 正在接手一部分搜索:拿到问题自动拆解、发多轮 Web 查询、交叉核对来源,产出带引用的长报告。开源代表有 STORM、Co-STORM、OmniThink,商业侧是 OpenAI 和 Gemini 的 Deep Research。这类系统给人「全网漫游」的印象,Cornell Tech 的测量画出相反的图:在理财、医疗、产品推荐这类话题上,不管用户怎么换措辞,三个开源 Agent 反复落在同几个 Reddit 帖、维基条目和论坛页。176 个问题里,UGC(user-generated content,公开可编辑的用户生成内容)占检索 URL 的 16.7-23.4%,Reddit 一家就占其中 53.7-70.7%。商业系统也有暴露面:Gemini Deep Research 的引用有 12.1% 指向 UGC,OpenAI 版只有 0.4%。

检索高度集中,页面人人可写、审核松弛,两边一拼就是一个完整的投毒面。

方法

攻击叫 WARP(Web Agent Retrieval Poisoning),三步:

评估框架 GEOSTORM 拦截 Agent 的检索调用:目标 URL 被正常检索到时,才把毒文拼进返回内容,真实网页不动。两个场景分开测:SERP 快照(搜索结果自带的约 25 词摘要,Reddit 屏蔽抓取后 Agent 只能拿到这个)和全文(整帖 2000-19000 字符,毒文占 0.5-3.9%)。

攻击者全程不用预测用户的问题原文,不用猜 Agent 的中间查询,也不需要了解检索栈内部。没被检索到就绝无提及,攻击者无法强制检索。

结果

SERP 快照场景,约 13 词毒文:

系统曝光率整体提及率条件提及率(曝光后)
Co-STORM(单 URL)60.6%30.7%50.6%
STORM(单 URL)76.2%37.1%48.6%
OmniThink(单 URL)57.4%21.7%37.8%
STORM(整个子版块)90.3%51.4%56.9%

瓶颈在曝光,不在传播。Co-STORM 的条件引用率是 100%:毒文一旦被检索到,必然进知识库。架构差异明显:Co-STORM 对快照照单全收,最脆弱;OmniThink 用嵌入相似度选块,多一道相关性闸门,最抗打,条件引用率仍有 46-67%。

全文场景毒性被稀释但没有被中和:毒文只占检索内容的 0.5-3.9%,条件提及率 Co-STORM 52.5%、STORM 40.6%、OmniThink 29.7%,三个系统都不过滤单个 URL 内部的内容。长度消融显示约 8 词就能进知识库;约 20 词、一句完整的推荐语,就足以让 Co-STORM 和 STORM 的提及率到顶。

医疗补剂场景最扎手:460 条从真实帖子改写的高风险查询里,单 URL 投毒让 Agent 在 10% 的报告里推荐了一个不存在的补剂化合物。论文初版公开后,一个医疗补剂子版块确认自己已在被类似手法攻击,随即修改了审核规则。

防御三个方向全部不及格。屏蔽八个 UGC 域挡得住攻击,报告质量分从 4.30 微降到 4.26,代价是连真实社区经验一起丢掉。困惑度检测(perplexity,语言模型给文本的流畅度打分)方向反了:毒文比正常 UGC 更流畅(GPT-2 困惑度 3.29 对 3.51),三种检测器 AUROC 全低于 0.68,按高困惑度过滤会误杀正常内容、放过毒文。输出侧比对同样没有可用的判据:被投毒的报告与干净版嵌入相似度 0.86-0.90,和同簇干净报告之间的相似度同级,风格上无法区分。

为什么重要

这篇把一个直觉变成可复现的测量:多轮多查询检索并不天然带来来源多样性,在商业价值高的话题上反而坍缩到一小撮可编辑页面。做 Agent 检索管线的人需要记住,来源多样性要显式设计,指望「多搜几轮」兜底不成立;OmniThink 的选块闸门是测试里唯一降低攻击成功率的架构特性,但也不够。对内容平台,这是治理 AI 垃圾之外的第二条战线:真人语料既是 Agent 最信任的原料,也是成本最低的攻击入口。一项覆盖 40 多亿条引用的行业分析显示,Reddit 是 ChatGPT、Google AI Overviews 和 Perplexity 引用最多的域名。

这是安全测量工作,不提出新方法。它的分量在于攻击假设极弱(零白盒知识)、数字够硬,且攻击已在野外发生。

局限与存疑

作者自列的:给 OpenAI 和 Gemini 的 Deep Research 做端到端测试需要往真实网页投毒、污染公共信息环境,被作者判定不可接受,闭源系统只能做引用分析;搜索索引有时滞,攻击面随时间的漂移没测;音频视频 UGC 没碰(产品对比类查询里 YouTube 链接占 STORM 检索的 15%);毒文在真实平台审核下的存活率没评估;11 个话题簇、176 条查询只是 4334 条语料的采样。

读下来再补两点。攻击有天然天花板,UGC 讨论稀薄的话题(减重补剂簇)曝光率接近零,威胁集中在社区讨论密集的领域。防御评估只测了代表性机制,屏蔽 UGC 的质量影响用打分和嵌入多样性衡量,这两个指标对来源构成本身不敏感,长期信息损失可能被低估。

术语

原文与代码

社区讨论

相关论文

全部论文解读