Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao
cs.AI
2026-07-23
往 Deep Research 检索池塞一份伪造论文,假结论采纳率从 0% 跳到 54.7%;临成稿前塞,冲到 85.5%;事前事后两道防御只能压低压不掉。
Deep Research 是当下 LLM agent 的一类热门形态:接到一个问题后自己拆解、反复搜索、攒中间分析,最后产出一份长报告。它正被推进到科研、尽调这类知识密集场景。问题在于,整个流程要一路从开放网络里捞资料,而网上本来就混着过时、站不住脚、甚至纯编造的内容。短问答和 RAG 领域早就研究过「给模型喂误导上下文」会怎样,但 Deep Research 是另一种体制:一篇假资料可能被选进流程、压缩进某个中间状态、隔几轮再被翻出来写进终稿,中间没人核对。这篇问的就是,在长链路研究里,Deep Research agent 能不能扛住一份「看起来权威、实则造假」的资料。
作者造了一个叫 MisKnow-Agent 的框架,专门生产可控的误导资料来压测这些 agent。流程是:给 DeepResearch Bench 里的每个任务,先定一条「已经人工核实为假」的目标结论,再按机构权威度(高/中/低)和文体(论文/新闻/博客/帖子)两个维度批量生成支持这条假结论的文档。关键设计有两个。一是「搜索引导的精修循环」:每篇文档要过 5 个带搜索的验证模型(GLM-5、Kimi 2.6、DeepSeek-V4 Pro、Qwen3.5-397B、Intern-S1-Pro),5 个都判它「在真实世界查不到、判定为假」才留下,否则打回重写,直到一致为假或用完预算,这样筛下来拿到 5933 篇质量可控的误导文档。二是评估口径 FCAR(false-conclusion adoption rate):只数那些「把假结论当成自己结论」的报告,光是引用、转述、存疑或反驳都不算。判官用 DeepSeek-V4 Pro,和人工在 300 篇上对过,原始一致率 99.7%、Cohen κ 0.993。
被测的是 DeerFlow 和 WebThinker 两个开源框架,各配三个骨干模型(DeepSeek-V4 Pro、Qwen3.5-397B、Intern-S1-Pro),外加闭源的 Gemini Deep Research。误导文档塞进它们隔离的检索池,搜索后端统一用 Serper。
核心数字很直接。不注水的对照组,FCAR 是 0%,没有任何一个系统会自己凭空产出那条任务特定的假结论。往检索池塞一篇误导文档,平均 FCAR 就跳到 54.7%;塞两篇 59.5%、三篇 61.0% 封顶,四篇五篇不再涨。一篇就够了,堆量没有累积效应。
几个变量里,「什么时候被看到」影响最大。在研究刚开始(冷启动)注入 FCAR 是 40.5%,研究进行中是 44.2%,但临到最终成稿前注入,冲到 85.5%。临门一脚塞进去的假资料,几乎一定会被写进报告。
「长什么样」也有规律。机构权威度从高到低,FCAR 从 61.0% 降到 46.2%(差 14.8 个点);文体上论文体最毒(61.0%),帖子最弱(37.5%),论文到帖子差 23.5 个点,比权威度的差距还大。论文的「样子」比挂谁的名字更管用。
| 变量 | 设置 | 平均 FCAR |
| 注入时机 | 冷启动 / 进行中 / 临成稿前 | 40.5% / 44.2% / 85.5% |
| 机构权威度 | 高 / 中 / 低 | 61.0% / 57.7% / 46.2% |
| 文体 | 论文 / 博客 / 新闻 / 帖子 | 61.0% / 53.0% / 44.0% / 37.5% |
| 文档数 | 0 / 1 / 3 / 5 | 0% / 54.7% / 61.0% / 58.3% |
框架之间也有差距。同配高权威论文体下,DeerFlow 平均 67.0%、WebThinker 55.0%。作者拆解发现,DeerFlow 是「规划、研究、汇报」直筒子,检索到的文档基本原样传给汇报环节;WebThinker 会把任务切成更细的子查询、把证据压进文档记忆、分段起草,多一道工序,所以更容易在中间把假料丢掉。但骨干模型越强(Intelligence Index 越高),两个框架的差距越小。
闭源的 Gemini Deep Research 走的是同样的方向:高权威 54%、论文体 54%,只是它对文档数量更敏感(一篇 27%、三篇 54%)。这说明这个毛病不是开源 pipeline 独有。
对在用或在做 Deep Research 类产品的人,这篇的结论得当风险看。其一,5 个带搜索的模型都能一致判定某篇文档是假的,可 agent 在长链路里照样把它当结论写进终稿,「孤立能识别」不等于「流程里不被带偏」。其二,最危险的是临成稿前的注入,而这恰恰是很多 agent 防御最薄的地方。作者试了两道防御:事前给一段「把检索信息当未核实、关键结论要有独立来源」的提示,事后派一个带搜索的 agent 逐条核对终稿。两道都能把 FCAR 压下来(事后那道最低能压到 20%),但谁也压不到零,而且合起来不一定比单用更好(Intern-S1-Pro 上组合防御反而比单用更差)。结论很明确:验证不能只放在首尾,得嵌进每一次证据采集和最终综合。
作者和读者都能看出的几条。任务集只用 DeepResearch Bench 的 100 个任务;闭源系统只测了 Gemini 一个;误导文档是插在隔离检索池里模拟的,和真实开放网络的噪声不完全是一回事,真实环境下假料不会这么整齐地按权威度和文体排好。防御的效果也随模型波动,组合防御在 Intern-S1-Pro 上反而劣化,作者归因于事后精修跑在和原研究同一个被污染的检索环境里,可能把假料又捞回来。这套机制是否在更大任务集和更多闭源系统上成立,还没验证。