研究:Deep Research 智能体采纳虚假信息的概率高达 85.5%
Justgototheeffinmoon · reddit · 2026-08-01
一篇 arXiv 论文揭示了当前深度研究智能体在信息验证上的严重漏洞。研究团队通过构建 MisKnow-Agent 框架生成了近 6000 条误导性知识实例,并将其注入到 DeerFlow、WebThinker 和 Gemini Deep Research 等框架中进行测试。
核心发现
- 极易被误导:在没有注入的正常环境下,错误采纳率为 0%;但仅注入一份误导性文档,采纳率就飙升至 54.7%。
- 时机决定一切:误导信息的注入时机比内容本身更重要。如果在最终综合报告前(即冷启动或研究中期)注入,采纳率约为 40%-44%;但如果在即将生成最终答案前注入,采纳率高达 85.5%。
- 防御机制失效:即使前置验证提示词或后置审查智能体能正确识别出文档是有害的,主智能体有时仍会采纳其结论。这说明标记风险并不等于拒绝执行。
所属事件:研究称Deep Research智能体极易受误导信息影响(2 条相关)→
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- 超1300名AI员工签署前沿发展倡议,专家呼吁细化监管 — peterwildeford · 2026-08-01
- OpenAI 聘前 DARPA 专家负责生物韧性,布局 AI 生物安全 — woj_zaremba · 2026-08-01
- Snapchat新规:纯AI生成视频将无法进入Spotlight推荐 — Polymarket · 2026-08-01
- Gary Marcus炮轰Anthropic:AI安全领头羊已「力不从心」 — Gary Marcus · 2026-08-01
- Google DeepMind 发布 AGI 安全总结:推动思维链透明度成行业共识 — NeelNanda5 · 2026-08-01